{"as_of":"2026-08-22T12:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:186e977b474e727953a52da2a0d872bb9a286a8a4675453f6f5c08bd0ff25209","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T17:38:16.149221Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.23723/citation-record","integrity":"/paper/2603.23723/integrity","json":"/paper/2603.23723/citation-record.json","paper":"/paper/2603.23723"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.831858Z","title":"Some experiments on the recognition of speech, with one and two ears,","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.831858Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:4edb4aef88c8c0148bfa8d02a837d70e595e9449d00cc265c5cf2b799e1647ba","observation_id":"ee69361e-afe4-40db-84b2-7ea689b47d5d","resolution":{"observed_at":"2026-08-02T17:38:15.831858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.836769Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.836769Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:81133104087f620b813b92cf328ab87c9184c643812394a22718145b824f06ef","observation_id":"5e05d736-96d3-459b-b225-888eb763e09a","resolution":{"observed_at":"2026-08-02T17:38:15.836769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.840860Z","title":"Multi-channel speech separation using spatially selective deep non-linear filters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.840860Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:c6ae0f429c9c559ed34cf46bf1543f8ede0d6c3ed998e9c500d52924e1b64320","observation_id":"78731d87-57e1-4c11-9e26-8a22e0758512","resolution":{"observed_at":"2026-08-02T17:38:15.840860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.844839Z","title":"Spatially selective speaker separation using a DNN with a location dependent feature extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.844839Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:4f204ce6c10ae8e555a44ed50cdab6875e7d4dd56ce3706e068e0a93ceee49d1","observation_id":"fedab810-e774-4770-bc5a-d81ba15107a8","resolution":{"observed_at":"2026-08-02T17:38:15.844839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.849093Z","title":"Insights into deep non-linear filters for im- proved multi-channel speech enhancement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.849093Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:92b99e3e6b0bf4df5cb4ecd40e8bb91425fdd135e2c44436b5f986c65ca11af7","observation_id":"d6b6239b-84db-480e-aca9-ce635782dc0b","resolution":{"observed_at":"2026-08-02T17:38:15.849093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.852873Z","title":"End-to-end DOA-guided speech extraction in noisy multi-talker scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.852873Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:14c6d58af493750eef5688190b9cfe499ecd49dc338859dd49d54a79f109c921","observation_id":"7c44709b-169b-40d3-93ff-250b091ac5d4","resolution":{"observed_at":"2026-08-02T17:38:15.852873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.857221Z","title":"All neural low- latency directional speech extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.857221Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:5cd5cc22f7b1e1f5012e54932b4f8e6ff47af70a507711346a3ebbb7b7777ea3","observation_id":"45c87fd2-5a4f-47ae-a46e-e98d8031c838","resolution":{"observed_at":"2026-08-02T17:38:15.857221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.860969Z","title":"ReZero: Region-customizable sound extraction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.860969Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:f1e6222aee4a8eefeee9a48f8afc18a8d514f7aab523675c0730af58dd602a36","observation_id":"279522c4-a177-4e1b-b16d-3ac12afac8e8","resolution":{"observed_at":"2026-08-02T17:38:15.860969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.864727Z","title":"Multichannel-to-multichannel target sound extraction using direction and timestamp clues,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.864727Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:5686f18bfcadf8532999da77015968b5ea2cb4aa7f373c356d72108335e72150","observation_id":"dda3c1fc-9a22-427d-aad2-95d883660893","resolution":{"observed_at":"2026-08-02T17:38:15.864727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.868404Z","title":"Location-aware target speaker extraction for hearing aids,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.868404Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:35de08a5cb83d67f76285cc0f2c4b6bd91cccd6ec5ac4a24ded985fc438e3c38","observation_id":"33dc0c9f-3cf9-4c6c-b6d6-85757e3c0d5d","resolution":{"observed_at":"2026-08-02T17:38:15.868404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.872005Z","title":"Continuous speech separation: Dataset and analysis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.872005Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:dda5304838cfcf661261d8cbbb1673f98b58faa114fde23d82d40021d1f80c7b","observation_id":"766a63cc-10dc-4467-8524-bee44c5fa861","resolution":{"observed_at":"2026-08-02T17:38:15.872005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.875563Z","title":"The fifth ’CHiME’ speech separation and recognition challenge: Dataset, task and base- lines,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.875563Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:e30a7ddbc65c31ee8be24b829ba8b24a317bf7b8baebb50596b24a0b0f32e115","observation_id":"7bcda0f7-0e26-4360-b011-b3ad0825631a","resolution":{"observed_at":"2026-08-02T17:38:15.875563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.879799Z","title":"Steering deep non-linear spatially selective filters for weakly guided extraction of moving speakers in dynamic scenarios,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.879799Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:df1b8cf089b00cc945586dfb322edccea1290d53e189236eb5f4b0b29b875e29","observation_id":"3e56abaf-a973-449e-9b48-133fb1173ced","resolution":{"observed_at":"2026-08-02T17:38:15.879799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.883570Z","title":"Self-steering deep non-linear spatially selective filters for efficient extraction of moving speakers under weak guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.883570Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:78a03dc367e4f2400d812f779c27350b4df69264380a8eaf0690ae4ae2ecb8da","observation_id":"935d93cf-aefd-4c2a-ba6e-353e7c333528","resolution":{"observed_at":"2026-08-02T17:38:15.883570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.887494Z","title":"Adaptive rotary steering with joint autoregression for robust extraction of closely moving speakers in dynamic scenarios,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.887494Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:3065471ed4348772250259a43fb230dd599a8978e10debb6642abc317c2dee45","observation_id":"18f07475-e2ae-48db-b279-f491d0a5c387","resolution":{"observed_at":"2026-08-02T17:38:15.887494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.891201Z","title":"Robust sound source tracking using SRP-PHAT and 3D convolutional neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.891201Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:afaefb51da1f1744d040ab1dcb71f9fc6f06607a976994f3e0b02b2a153d26d2","observation_id":"9a946ab7-f424-4396-b4f8-74647a2f6076","resolution":{"observed_at":"2026-08-02T17:38:15.891201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.895240Z","title":"Exploiting temporal context in CNN based multisource DoA estimation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.895240Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:72638135a69b9f766b235af40b4d54fbd9134ce365dd1b559f1560c41ea117fe","observation_id":"7ffcc3f0-eaa6-446d-b85d-44d07d9e6dd6","resolution":{"observed_at":"2026-08-02T17:38:15.895240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.899252Z","title":"SRP-DNN: Learning direct-path phase difference for multiple moving sound source localization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.899252Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:be33d03e03ad277a58af48eab003e6f3d890c265fa0bee7ad6e33d5a9a986851","observation_id":"cb044c9e-8063-4872-b038-87aed62d3c28","resolution":{"observed_at":"2026-08-02T17:38:15.899252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.902984Z","title":"FN-SSL: Full-band and narrow-band fusion for sound source localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.902984Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:f4036b217d29b4f13fe64ed084631b98bb1087c80df4b06f544ff2070c25fe42","observation_id":"d7f907ae-e77d-48fe-9443-a3e297e383bf","resolution":{"observed_at":"2026-08-02T17:38:15.902984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.906836Z","title":"TF-Mamba: A time-frequency network for sound source localization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.906836Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:67a73a969ac4382e1a878f2d946447eea4ae959b8ebbd623c3ebfb972b714abb","observation_id":"adaf68ee-d742-4a61-9787-6bbae715e1ff","resolution":{"observed_at":"2026-08-02T17:38:15.906836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.910570Z","title":"A convolutional recurrent neural network for real-time speech enhancement,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.910570Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:5ef09a1b5dc0f796192d0de3137d9750137a41667ead153cbbf9fd36cf0a45d9","observation_id":"56c34e62-b9c9-4bfd-9e13-054bfd6966d0","resolution":{"observed_at":"2026-08-02T17:38:15.910570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.914187Z","title":"Real time speech enhancement in the waveform domain,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.914187Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:612156b70e9ac2b47693c887285fc6a8e9c3e0225de980308d28f8d635a00940","observation_id":"fece998f-58e1-4b36-9f4e-8e61cdf15c31","resolution":{"observed_at":"2026-08-02T17:38:15.914187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.918463Z","title":"Towards efficient models for real-time deep noise suppression,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.918463Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:7cd4f4fc6b503e17dbc84d27ca098e6ce2d3a5583f76440fe2d487affe624691","observation_id":"165299e8-d76f-48d6-a69a-24987a9ae63e","resolution":{"observed_at":"2026-08-02T17:38:15.918463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.922344Z","title":"Conv-TasNet: Surpassing ideal time–frequency magnitude masking for speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.922344Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:ad71b71dd0cdd66536f3661bc1925e3cb5fe312f56ebbd77b4e1f905595bc4ce","observation_id":"d52a1fac-5d43-44a6-8127-d8469af18f22","resolution":{"observed_at":"2026-08-02T17:38:15.922344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.926190Z","title":"An investigation of incorporating Mamba for speech enhancement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.926190Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:0e32071a4789ef2c9313cd728a4d6eba626a727d0b9e0f16ed58c512d8a9ba8e","observation_id":"144f0c58-3480-4a32-98a8-70ccf12e99e0","resolution":{"observed_at":"2026-08-02T17:38:15.926190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.930073Z","title":"Iterative autoregression: A novel trick to improve your low-latency speech enhancement model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.930073Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:82afec1f2b05420909410fddf0a2d1df4698560ebbbebb5fe1556f8bc418c0fb","observation_id":"6e16f423-0b06-4d33-9b2f-52e48566095e","resolution":{"observed_at":"2026-08-02T17:38:15.930073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.933966Z","title":"PARIS: Pseudo-autoregressive siamese training for online speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.933966Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:62c6e7767785740cba8c181c200e3dcf3128b4715dbfba1e0bcad4f5ff50236d","observation_id":"c5b7d636-5042-45fc-8ba5-07247f6a66d8","resolution":{"observed_at":"2026-08-02T17:38:15.933966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.938085Z","title":"ARiSE: Auto-regressive multi- channel speech enhancement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.938085Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:8c9d998e0bcd8b0ce8217333aeeea6de9cccbd9a0f06dc2400935e553fc995df","observation_id":"602d12e5-07c4-474d-8e6b-51b5cdac9e22","resolution":{"observed_at":"2026-08-02T17:38:15.938085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.951465Z","title":"A wrapped Kalman filter for azimuthal speaker tracking,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.951465Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:e34dbecd300503ab2e3e1f319f2bed2426fc490e5104bdfe54b4f0ad2efd8f42","observation_id":"c65b9c72-8fae-4eb6-940a-1c36a07f7539","resolution":{"observed_at":"2026-08-02T17:38:15.951465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.955556Z","title":"Particle filtering algorithms for tracking an acoustic source in a reverberant environment,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.955556Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:d19f760201eac93b01ca8b864b8576da95fbf8f33cad9de255615ac6f6aa89d4","observation_id":"422f8c83-e3d1-4fda-8e04-686589201289","resolution":{"observed_at":"2026-08-02T17:38:15.955556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.959620Z","title":"Social force model for pedestrian dynamics,","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.959620Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:41db6234fe3bd68e3032ce565d7d03bcc7ac06e8c0d7de32165372b92ea95343","observation_id":"7a8ca5bb-8f57-4d16-8a06-283993dfbd4a","resolution":{"observed_at":"2026-08-02T17:38:15.959620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.963510Z","title":"Benesty, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.963510Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:be118ddb44b866cb90c9d3b1f69e314c539852d447492288b8a26f68fbc90cb6","observation_id":"28b2f17c-0a6b-4eea-8838-9a73f36215de","resolution":{"observed_at":"2026-08-02T17:38:15.963510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.967302Z","title":"S ¨arkk¨a,Bayesian Filtering and Smoothing","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.967302Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:e0f43d8a7ba34bad476474ba54146ddb7d6b40aeae68e52bd74ba1d9f832907f","observation_id":"e256661e-9c44-49b0-a8f5-a478969c9af4","resolution":{"observed_at":"2026-08-02T17:38:15.967302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.970978Z","title":"A new approach to linear filtering and prediction problems,","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.970978Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:8950029ea1e751ecdc8b3cb38d411098f43fca41a496b60b4318257000ada6d4","observation_id":"cb629f12-d681-4107-99d0-b321fc7899df","resolution":{"observed_at":"2026-08-02T17:38:15.970978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.974997Z","title":"Survey of maneuvering target tracking. Part I. Dynamic models,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.974997Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:2765620d0211e5326809b803e1098ac2d1b385053801ef32c627e5a2460b662f","observation_id":"e70cf4e6-4467-41ec-851e-f88e2faf32e9","resolution":{"observed_at":"2026-08-02T17:38:15.974997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.979344Z","title":"Particle filtering approaches for multiple acoustic source detection and 2-D direction of arrival estimation using a single acoustic vector sensor,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.979344Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:f2c76f6647d64e783c27344b7dcfcd7534cb3d56321dd1df7948b5fe561d7718","observation_id":"04f5a10a-33e0-43b0-a1f3-cc929b8134ce","resolution":{"observed_at":"2026-08-02T17:38:15.979344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.983779Z","title":"Particle filter algorithm for DoA tracking using co-prime array,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.983779Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:2146203e0fe7a38630ac8e17bab636ca303036ab73ddeb432afa822f4a911432","observation_id":"94c5b0b5-7cf2-4858-b8db-8d86cff6b7ff","resolution":{"observed_at":"2026-08-02T17:38:15.983779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.987779Z","title":"Multichannel source separation and tracking with phase dif- ferences by random sample consensus,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.987779Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:a35e12ae4634fb4b37010f6f702c9997b6bf370551358fa72b7b885eeb622605","observation_id":"889cc773-1818-492f-a7ed-a3168d227135","resolution":{"observed_at":"2026-08-02T17:38:15.987779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.991931Z","title":"A low complexity weighted least squares narrowband DOA estimator for arbitrary array geometries,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.991931Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:c2b27efc5c5cd68006b60935b33fbbec0ccc9d247cd4c46742423741231b06e1","observation_id":"8c62378b-dffc-45a5-afa7-0e3815d9d904","resolution":{"observed_at":"2026-08-02T17:38:15.991931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:15.996426Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:15.996426Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:6c2a1d9d0946d49281e2c7169c3188454fe74b6d4a4811efbbd45d40e7613097","observation_id":"def22d75-953a-4843-8512-fb561331ffa8","resolution":{"observed_at":"2026-08-02T17:38:15.996426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.000266Z","title":"Novel approach to nonlinear/non-Gaussian Bayesian state estimation,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.000266Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:9dcf1172324a0bde490d3c3b34b70c3df77810e080b9117256ce1ccf19e207a5","observation_id":"65296b05-cb74-49e2-9f09-eabb54d3b439","resolution":{"observed_at":"2026-08-02T17:38:16.000266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.004522Z","title":"A tutorial on particle filters for online nonlinear/non-Gaussian Bayesian tracking,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.004522Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:d686651d87213e44a33fbd4cf4e5dc3ff5d8305e5a665f062b180fa71fedb77c","observation_id":"660f57e0-5846-4e5b-a588-a322750ece1f","resolution":{"observed_at":"2026-08-02T17:38:16.004522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.008766Z","title":"DOA-estimation based on a complex Watson kernel method,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.008766Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:70517e21b4ee3ec9bdb5b5681920216c50191aff07b35c3a7fd1099f3eb8382d","observation_id":"a773220f-0cdb-45ab-b2d1-50b760ecb59e","resolution":{"observed_at":"2026-08-02T17:38:16.008766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.013094Z","title":"Target speaker localization based on the complex Watson mixture model and time-frequency selection neural network,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.013094Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:ca60baac92f12100f4a4239b846fc7cd9645d438dfa8659769ec053f7ded1b78","observation_id":"1b20af9a-a3bc-43ad-84af-1ea524c2b452","resolution":{"observed_at":"2026-08-02T17:38:16.013094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.017545Z","title":"On optimal multichannel mean-squared error estimators for speech enhancement,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.017545Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:4740102049021ebb02e78df8ab8d8d2228821cb125acf6264951a0e5541b1e83","observation_id":"6fc88b72-b8db-44ca-8d8b-1b5bbcbfb02f","resolution":{"observed_at":"2026-08-02T17:38:16.017545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.021724Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.021724Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:6fbd1be29e9af939d18ab2869f915e7e73b26cb0b2df1c3f5795075bc0b69437","observation_id":"04d75ef4-413d-4f6f-8db6-94f17d9bd064","resolution":{"observed_at":"2026-08-02T17:38:16.021724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.026087Z","title":"Particle filter with integrated voice activity detection for acoustic source tracking,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.026087Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:fae30d1290613fed531ae3ac2e02e74017aed0c59052c17b3d973c960ffc4faf","observation_id":"38977103-5366-4645-8573-c1e485fc2258","resolution":{"observed_at":"2026-08-02T17:38:16.026087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.030178Z","title":"GCC-Speaker: Target speaker localization with optimal speaker-dependent weighting in multi-speaker scenarios,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.030178Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:4e1f6a06b2b38a0bf92adfa74ee0e6ea8569f3687fd7c33d7521ecb5e7388d18","observation_id":"3fee10fc-fb48-45ed-94d1-0da44dae1ee1","resolution":{"observed_at":"2026-08-02T17:38:16.030178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.034259Z","title":"LocSelect: Target speaker localization with an auditory selective hearing mechanism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.034259Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:4545c21fb8d40c8240307ab8ed479d817a96e12d687c378c9dc136086531b191","observation_id":"b9f7d58c-a8a1-4e6c-9a3d-755e8aa67159","resolution":{"observed_at":"2026-08-02T17:38:16.034259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.038404Z","title":"Robust frame-level speaker localization in reverberant and noisy envi- ronments by exploiting phase difference losses,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.038404Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:15e8a5c1df6ae4a8bc4abec8b5d2b8c72ca582226569974e990c663ad21ceee9","observation_id":"ee37fec2-36a0-4e0e-83b6-29105fa7860e","resolution":{"observed_at":"2026-08-02T17:38:16.038404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.042495Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.042495Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:940f12e7ec15af6ff6a935150bb76795b4487ce6f2a2c710b41daeec6a10bc9f","observation_id":"18471bbb-4a4b-4dd0-b959-25b0813f3c57","resolution":{"observed_at":"2026-08-02T17:38:16.042495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.046741Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.046741Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:ab2b9588fc215436e8f2d8e558073eeb3e92715fc31acdcbc27558e203c434d8","observation_id":"c674ac4e-9480-45ce-87b1-90c720f8e70a","resolution":{"observed_at":"2026-08-02T17:38:16.046741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.056103Z","title":"gpuRIR: A Python library for room impulse response simulation with GPU acceleration,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.056103Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:e844f871db48aa4ac42771024bec6d1c9bd6398b89008cdcfab5633d94b37afd","observation_id":"27b19f25-9c7f-4c10-b915-c59fd2a99d56","resolution":{"observed_at":"2026-08-02T17:38:16.056103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.060094Z","title":"Image method for efficiently simulating small- room acoustics,","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.060094Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:d1ab376b94a77a2b5ebadbb98ea5ee4c4be1261a68c48898ddd7d643f48059ad","observation_id":"643cb670-5b60-435d-bd42-a7347f56b255","resolution":{"observed_at":"2026-08-02T17:38:16.060094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.064192Z","title":"Generating sensor signals in isotropic noise fields,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.064192Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:99944db8345b08b26b671a2e1f5e95d1541afcbe39650723bc69b153874cfb8e","observation_id":"136c13c8-7027-4a96-901a-eca603b3b334","resolution":{"observed_at":"2026-08-02T17:38:16.064192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.068270Z","title":"Mask-based neural beamforming for moving speakers with self-attention-based tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.068270Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:acaa2b8ae8ffea105530b7457389d2a42ece4f664efab4abbeb122728088dc4d","observation_id":"f16afa6a-2da7-4e9c-8474-10dede4b7b44","resolution":{"observed_at":"2026-08-02T17:38:16.068270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.072019Z","title":"Array geometry-robust attention-based neural beamformer for moving speakers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.072019Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:39e73e775d021bdd486702aaffc4d1ac08d10ff74d46d1c5a1a844e3cc0d3c07","observation_id":"84800092-5db8-4008-8ae9-0f51bd753267","resolution":{"observed_at":"2026-08-02T17:38:16.072019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.077621Z","title":"Characterization of moving sound sources direction-of-arrival estimation using different deep learning architectures,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.077621Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:34c81d3c811a6100bee12b1024574783d837c1e16027a33eb185837297bfb8af","observation_id":"55c988a7-63e2-4c9a-ab26-25299f1ff135","resolution":{"observed_at":"2026-08-02T17:38:16.077621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.081885Z","title":"Goldstein, J","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.081885Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:a5dca0f7ff5387300227007fa35eecffc0874f68738ff0520a2b298605378dad","observation_id":"c4fe63c5-a5df-4108-bb52-f4202fba74e3","resolution":{"observed_at":"2026-08-02T17:38:16.081885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.086587Z","title":"Outdoor walking speeds of apparently healthy adults: A systematic review and meta-analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.086587Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:89d61d703db5e60beaae407fb76d5f898aae41207f3783d05537ebfeec1dcbfd","observation_id":"3a0d40bb-127b-475d-a7c0-628fac5e0b8c","resolution":{"observed_at":"2026-08-02T17:38:16.086587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.090857Z","title":"Specification of the social force pedestrian model by evolutionary adjustment to video tracking data,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.090857Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:cf2ccd7f2f9cc0094c48c64eb67d79fbe6def206d5a133b518ba3e4c57ea7c16","observation_id":"f31c5547-b84c-42db-9f0f-68f36cb66569","resolution":{"observed_at":"2026-08-02T17:38:16.090857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.095481Z","title":"SpatialNet: Extensively learning spatial information for multichannel joint speech separation, denoising and dereverberation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.095481Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:41e1cace6dfbb6f30f07a10259c68e5ac7f10a840aa1cc7197e05b1b75cd2fe1","observation_id":"629a19dc-9ef8-45f3-8fe5-446e86002cb5","resolution":{"observed_at":"2026-08-02T17:38:16.095481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.099439Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.099439Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:1bb4218b822cc5d5e9fa0736df45d8409c9c436feb3a8401a6b5adda37ddd1eb","observation_id":"b0bd374a-9269-4c22-b604-e19a2042c100","resolution":{"observed_at":"2026-08-02T17:38:16.099439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.103642Z","title":"Multichannel long-term streaming neural speech enhancement for static and moving speakers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.103642Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:2c6f44e7204b5642f36c36d22e36b36fb58c0585af3ca31159ac1cfafed2c7e5","observation_id":"d33a53dd-9c82-4168-b24e-713dcec5731b","resolution":{"observed_at":"2026-08-02T17:38:16.103642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.108144Z","title":"Leveraging sound source trajectories for universal sound separation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.108144Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:17a38d7568120283530613f47de106359548eaf1deeaebc06fde9f8239035b43","observation_id":"0fd51d49-ffe1-42a6-90bb-b078bbd8fcb1","resolution":{"observed_at":"2026-08-02T17:38:16.108144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.112137Z","title":"Recurrent deep stacking networks for supervised speech separation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.112137Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:de57019eca0286b6fd4f64c4f12bc989533caa0057cf06c5b6f1971d747bc894","observation_id":"82651d90-30f3-4be2-b6f1-877e4a9cf815","resolution":{"observed_at":"2026-08-02T17:38:16.112137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.116229Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.116229Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:d3f422ee1e0d430bd7d88fdda2d312a968da708483783bdd94aaf6edad1ab06c","observation_id":"b1d7bbb7-3c05-4883-b124-a7ec0c166823","resolution":{"observed_at":"2026-08-02T17:38:16.116229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.120741Z","title":"An algorithm for predicting the intelligibility of speech masked by modulated noise maskers,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.120741Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:add182c68a8e5812acdb8b5130e16f6945384131718a92f5fb0933b656f12c72","observation_id":"8270d47f-f88f-4909-8d83-b0db5a9ae679","resolution":{"observed_at":"2026-08-02T17:38:16.120741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.125143Z","title":"Sound event localization and detection of overlapping sources using convolutional recurrent neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.125143Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:69a35ee72148762dae26734df67f6081745960367513df15ea029a6df6afed09","observation_id":"d9762e82-a8cb-46dc-990d-5dd05c616458","resolution":{"observed_at":"2026-08-02T17:38:16.125143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.129271Z","title":"6DoF SELD: Sound event localization and detection using microphones and motion tracking sensors on self-motioning human,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.129271Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:4413810b25152ba373081dd4d98f777bb37e1481640ee7b7fd90d17b2f9d8a70","observation_id":"89f775c4-e22d-43ca-9310-1e3c6d94a8f5","resolution":{"observed_at":"2026-08-02T17:38:16.129271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.133225Z","title":"The LOCATA challenge: Acoustic source localization and tracking,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.133225Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:049230a8061ffb21a8d541c1d18edc7baf27a875521471d52603619c9a8fb635","observation_id":"debe19d3-596f-4faa-b17a-ea84762b030b","resolution":{"observed_at":"2026-08-02T17:38:16.133225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.137146Z","title":"SDR – Half- baked or well done?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.137146Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:533af9208aaae6feda6d5a41ab64c46cfb652f72eeb2e1c6f2320762bf6359d8","observation_id":"cfdf87fc-730d-4fbc-92c3-0802a6d63b4c","resolution":{"observed_at":"2026-08-02T17:38:16.137146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.141228Z","title":"Fairbanks,Voice and Articulation Drillbook","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.141228Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:c6a845a74ec34faf1dd0b9428bd3f65315f8d7aa460e277813c084a49d86b1a2","observation_id":"e7a31caf-0005-41fd-98a4-90ef989a15e9","resolution":{"observed_at":"2026-08-02T17:38:16.141228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.145345Z","title":"NISQA: A deep CNN- self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.145345Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:af7b07cb5deae3760dd29049f067f5b631cff1980390769d28dac32d883faf8c","observation_id":"427d97d9-d5b7-419f-a4ef-fbfadac37598","resolution":{"observed_at":"2026-08-02T17:38:16.145345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:38:16.149221Z","title":"NeMo: A toolkit for building AI applica- tions using neural modules,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.149221Z"},"links":{"citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:d689c08bc424b8867b126c35adc0507692ca85e66b5a6fd8bc642e2f5e074c8b","observation_id":"939fb81f-73c0-4b11-9966-a9d900853f15","resolution":{"observed_at":"2026-08-02T17:38:16.149221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-02T17:38:16.051420Z","title":"Available: https://arxiv.org/abs/2005.11262","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T17:38:16.051420Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2603.23723"},"observation_digest":"sha256:bb25c84d9c5518523daa98a685d54c85504088f680377ab292fd564c0557b5fd","observation_id":"3b04f370-561f-4dec-bdea-985215ab7392","resolution":{"observed_at":"2026-08-02T17:38:16.051420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.23723","last_updated":"2026-07-16T11:10:40Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-03T20:26:05.507379Z","submitted_at":"2026-03-24T21:19:45Z","title":"Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2603.23723."}