{"as_of":"2026-08-09T06:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7769e8b7fd594883144139e37a25d8f7825839b25754a06fe84df1cce476d0b","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:38:54.409813Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03964/citation-record","integrity":"/paper/2608.03964/integrity","json":"/paper/2608.03964/citation-record.json","paper":"/paper/2608.03964"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.211546Z","title":"ACM Transactions on Graphics , volume =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.211546Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:e999f07ef4b4ba910f12fb3f787d1c689f3b2afdffe8c520334d8ea687e00bda","observation_id":"112c890a-9b33-4f67-b96c-f88dd6add5c8","resolution":{"observed_at":"2026-08-08T00:38:54.211546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.216918Z","title":"2025 , publisher=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.216918Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:f842ee0f91d1c08bb514becaf58e3ffe6a5f3f89096bba2e79085f4f8799af37","observation_id":"1b927815-17bc-4886-93d9-8328dba9f8f2","resolution":{"observed_at":"2026-08-08T00:38:54.216918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.220345Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.220345Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:e1cba0584404247f8e84e48f28ddbb940095924922e672e11653433e308f8564","observation_id":"7e894187-9100-46a6-8547-10060c2cb37e","resolution":{"observed_at":"2026-08-08T00:38:54.220345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.223368Z","title":"Interspeech , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.223368Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:a99d347852a07a67a17d7dde3e47a26151d52bda9c01533bdbefa28babf5b093","observation_id":"a800df13-33f0-4c3c-a4f2-850072516a9c","resolution":{"observed_at":"2026-08-08T00:38:54.223368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.226354Z","title":"2022 , doi =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.226354Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:ab1ce92bafe5e2eaddac89128c76c1c4dfe6580109569e3518d992331e9a2d20","observation_id":"61dd3564-683a-450b-845d-d1287cf94a61","resolution":{"observed_at":"2026-08-08T00:38:54.226354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.230320Z","title":"2019 , publisher=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.230320Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:059d99d96ac1e0f7016fe0d5feb2975fbd538d5f20a87b4160d759634210ee92","observation_id":"60a2f955-fd1c-414c-84b4-e3f86d41a8db","resolution":{"observed_at":"2026-08-08T00:38:54.230320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.234316Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , volume =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.234316Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:1f25548ee48f3815fd3b8e1ba19a676f5aabe51cad7497b2a95d682d4d6d70e4","observation_id":"b1da064b-7657-4104-8e98-88b95502d472","resolution":{"observed_at":"2026-08-08T00:38:54.234316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.238054Z","title":"Interspeech , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.238054Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:22e296949a29e87224995be7d73155acb8868f63adcb5e88a9ba37cc720b2196","observation_id":"79a3f8dc-cd62-4314-9f00-1e1d96af9493","resolution":{"observed_at":"2026-08-08T00:38:54.238054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.241584Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.241584Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:065bebecfd5618afcacf0fc055052bc1c58bb6aff023beecd5033ba11954b682","observation_id":"20b3a242-fc20-4c28-9ed8-f26fd7675079","resolution":{"observed_at":"2026-08-08T00:38:54.241584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.245641Z","title":"2018 , doi =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.245641Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:f127ba9b242c68bb6605a6de83a075fd24685e9c7dbd13694af6a70de39466b9","observation_id":"2194eccc-70b0-434a-b99e-f97e018babd5","resolution":{"observed_at":"2026-08-08T00:38:54.245641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.249341Z","title":", booktitle =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.249341Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:3e7874e23e51b4e77cdc3f6cc88e9b8be1c06150d0bab4375cc7992b7fbe77dd","observation_id":"d1d82b5c-84ad-4417-9f7b-419d06fa569a","resolution":{"observed_at":"2026-08-08T00:38:54.249341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.252885Z","title":"2017 , doi =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.252885Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:01337f96c7dccdad80ae243c0a63973045b7d94d8f3dcb9e256bfb1499f93623","observation_id":"539382fb-ce8d-46d8-a2ae-417fbefb4304","resolution":{"observed_at":"2026-08-08T00:38:54.252885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.256292Z","title":"2023 , doi =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.256292Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:d556afff130a33d5d59525b811476f88a2c119593666908050c9f2c4756aa2e6","observation_id":"7a3a86a3-2fcf-41b5-9193-2af8c5f0e682","resolution":{"observed_at":"2026-08-08T00:38:54.256292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.259841Z","title":"Scenario-Aware Audio-Visual","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.259841Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:c9e06c121fca18182cac10d9e9c9b51352b4bc225a91162b15ead24ea9ea4646","observation_id":"ad1c46d9-1b70-4424-8411-d6c996dd1d43","resolution":{"observed_at":"2026-08-08T00:38:54.259841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.263337Z","title":", title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.263337Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:c06793c09f027ddb1644b2022663812360f53930518ef4c809b0a9a8eea33642","observation_id":"1d007458-36a0-48fd-9d24-6c4607fd5b62","resolution":{"observed_at":"2026-08-08T00:38:54.263337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.266927Z","title":"2018 , doi =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.266927Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:bc31f64050d898c544eb31d29e80ba84badd3d9b276b965a4db0ee566f3f5363","observation_id":"e88cb523-481f-4f3f-be00-5b88767ba1c1","resolution":{"observed_at":"2026-08-08T00:38:54.266927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.270343Z","title":"2020 , doi =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.270343Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:4af72c48e1eeceb8f0f275a3f24d8f4c2908aac4d0725cca479d51d054e3aeff","observation_id":"3f31e0d4-41af-40d5-93f5-3a3e0df90af0","resolution":{"observed_at":"2026-08-08T00:38:54.270343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.274039Z","title":"2020 , doi =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.274039Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:e8455b279a91b6de9d29fe0a044db5824d4301bad8d8326d2baf7a041a6fbe15","observation_id":"ef4f2bf9-77aa-4a9e-8de0-12b4b396d984","resolution":{"observed_at":"2026-08-08T00:38:54.274039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.277716Z","title":"IEEE International Conference on Computer Vision , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.277716Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:caf7e4bab15a83c184b874ba91ebcbde1c2bc88fae280ddbe68846f7cf2e05f6","observation_id":"4266f7a6-6c7c-4505-9e9b-285d22f33640","resolution":{"observed_at":"2026-08-08T00:38:54.277716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.281291Z","title":"2015 , doi =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.281291Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:d4fcc453d8fa39de4b4e8171db2d38c0c857af0f6d77eb36f7c7b6a35081936b","observation_id":"6f8e3df5-751c-4209-8af3-da698735f802","resolution":{"observed_at":"2026-08-08T00:38:54.281291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.285144Z","title":"and Zisserman, Andrew , booktitle =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.285144Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:10c1dd0ef6b76a8bd931cc0d6acce592fbbf2b1e8ec18c2491b7b303a08f72da","observation_id":"807b4805-0e65-461e-aa90-f9a65874a224","resolution":{"observed_at":"2026-08-08T00:38:54.285144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.289014Z","title":"IEEE Transactions on Information Theory , volume =","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.289014Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:2ad5756fa04a3f085a6c98de3ff6775ec2ef1d966d1549e024cb07494de0376e","observation_id":"ab9bbf30-5cc8-4f92-b1bd-abca76a9406e","resolution":{"observed_at":"2026-08-08T00:38:54.289014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.292831Z","title":"ACM Multimedia , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.292831Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:cbc7948f6ade79f53802742170d7db4eaa722b3c558b9ab77542d5209df40bc4","observation_id":"5984d529-99f9-419b-a51a-12911f513f01","resolution":{"observed_at":"2026-08-08T00:38:54.292831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.296240Z","title":"The Annals of Statistics , volume =","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.296240Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:224e94f30023bf0113127e01d23808f3d5754f1593f5e5f4588b596d47600420","observation_id":"28122e67-d504-4689-9c89-c85ca1dddeed","resolution":{"observed_at":"2026-08-08T00:38:54.296240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.308651Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.308651Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:2be8f68afd29364e80d694eea14c3768f1d5ba89a86ce41825b14c77084803f2","observation_id":"a02291c4-9efc-460e-99ac-86008ad23aab","resolution":{"observed_at":"2026-08-08T00:38:54.308651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.311963Z","title":"2026 , doi =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.311963Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:19210397944c67d2d1a7bdd88973067b9d23815c09993518540162f3582cff69","observation_id":"03294fde-dc69-438b-a96b-649434e648de","resolution":{"observed_at":"2026-08-08T00:38:54.311963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.315406Z","title":"2025 , pages =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.315406Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:358066bb76849bc03a8a36cafcdbbc064494a3ee7cf6a37dcdb7445f7b71f24a","observation_id":"7b468ec1-be23-4dfc-8e6b-404de216cc77","resolution":{"observed_at":"2026-08-08T00:38:54.315406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.318691Z","title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.318691Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:ff95937ca48b447ba4571f6859e4b255e21041076b6e2ae51057b83a1beed290","observation_id":"b333e601-2da3-4327-8a19-d5cfc83df7de","resolution":{"observed_at":"2026-08-08T00:38:54.318691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-08T00:38:54.321955Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.321955Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:488aa6979d0618407939f88c6c2d3ab9f7846a679604d3516bd7f9e1b5323bda","observation_id":"86254853-121b-4cfb-a3a2-9fd481c3351c","resolution":{"observed_at":"2026-08-08T00:38:54.321955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.325800Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.325800Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:1132c578663ac05e9e5fefc965470b4ea3d1ef586ed926a4e820a1bec88baf06","observation_id":"474d28ca-f1d0-43b0-993b-49d471749e2c","resolution":{"observed_at":"2026-08-08T00:38:54.325800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.329420Z","title":"Parkhi, and Andrew Zisserman","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.329420Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:9a911d792ab1f98e8ab0330e865e9918e5be4d495ab893deb59a27b7a8d0aa11","observation_id":"0a328093-3103-4743-9785-21100acc16f8","resolution":{"observed_at":"2026-08-08T00:38:54.329420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.333168Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.333168Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:aa5a018daf7b4a93ac52158a5ab4b823d5ca5d13845ed748a07bd2c82629805a","observation_id":"65c05404-29c9-4730-bba4-30d59e2db9d7","resolution":{"observed_at":"2026-08-08T00:38:54.333168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.336600Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.336600Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:30afe21c6c05f32b9071b01945c5d6bdaa3bfa952f7fec7b9aacc69c78062430","observation_id":"8f61b9d5-5d86-4ab4-afb3-33107d51200a","resolution":{"observed_at":"2026-08-08T00:38:54.336600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.339648Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.339648Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:ff88366f01322deae1af84099c698b75028cb2a2e96a820411c96e3558557999","observation_id":"313acf9d-0870-4420-abe3-4b99a0d74da6","resolution":{"observed_at":"2026-08-08T00:38:54.339648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.342520Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.342520Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:cea24874bd89f4f77c072bbcea839679b8db236045853f86e807b14b0e4a7fee","observation_id":"ea59e885-92f5-4560-a346-74d4ce5299b2","resolution":{"observed_at":"2026-08-08T00:38:54.342520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.345337Z","title":"Freeman, and Michael Rubinstein","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.345337Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:72dcd9b53e401189d983942477414705a9c4ddc2d0c8498c847bd0ccc5e03257","observation_id":"bb2f8a39-2f60-4774-bd1c-231f8f3b3861","resolution":{"observed_at":"2026-08-08T00:38:54.345337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:55.206024Z","title":null,"venue":null,"work_id":"0ad5a703-fbdd-415d-9949-d44e3f1a2ef5","year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.348174Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:efe56c9d2017bf31fa0b77da04b687caf2a21052a21f18b292d807c36063f8b3","observation_id":"96e1c602-b0f3-4613-b820-20faf5b74c85","resolution":{"observed_at":"2026-08-08T00:38:55.208961Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.351032Z","title":"Levenshtein","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.351032Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:176637ee5212ecb45da51810ad2ad0b12db0505f9d844a3ace35e7a87efd9d7f","observation_id":"46ca842a-cc4c-49d1-9e69-0373a9275f21","resolution":{"observed_at":"2026-08-08T00:38:54.351032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.353708Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.353708Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:366f6937616480fdf1b0a12f626e18efe39bf8bae323d84f0a6dd70535c8698f","observation_id":"f662acfe-81d3-45c6-b467-6f7ec3a4da23","resolution":{"observed_at":"2026-08-08T00:38:54.353708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.356936Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.356936Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:94a4f5e70e9fbd4763e2fba250cdaaae6e54a352647e8e4d95092ba15bdf1558","observation_id":"044b5cc1-d2ee-45b1-9a6b-03240fad9dde","resolution":{"observed_at":"2026-08-08T00:38:54.356936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.359955Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.359955Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:771995e999a8cbe017e483ba12bb9c33e66f8fac16470705e74c816b57e26da7","observation_id":"5ed23fc1-67b8-474b-ac58-dba8ecfaf0ca","resolution":{"observed_at":"2026-08-08T00:38:54.359955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.363402Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.363402Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:ccdc3746cfa22c3f9d0186c0ba99c578ddfaf4fd93365e964be86c608d3aa18c","observation_id":"042ccf02-0a6f-4e25-b1fe-615dfb96d307","resolution":{"observed_at":"2026-08-08T00:38:54.363402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.366914Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.366914Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:03863beff6f9347bc8f05978b8c73ad4841938019b9b8916ba245288bebf588e","observation_id":"61a2b157-5986-4c77-9182-5c40862a7f61","resolution":{"observed_at":"2026-08-08T00:38:54.366914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.32057","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:55.089341Z","title":null,"venue":null,"work_id":"6847bf2e-c6de-488e-a1a8-2ca7cec05ad6","year":2022},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.370357Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:0622f6c333c05ec2e33ae00144232797f20dff0ca0856527f9b49028819e8eec","observation_id":"92025b76-f9ab-4d82-832e-057e8e627e9b","resolution":{"observed_at":"2026-08-08T00:38:55.094647Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.373896Z","title":"Germain, Sameer Khurana, Chiori Hori, and Jonathan Le Roux","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.373896Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:45384b617338d3b0eac38fdbb5e0b05ea0dbb71796d079468c75b7697e6793a0","observation_id":"94bb6707-9a05-4651-94e0-7ac82a880576","resolution":{"observed_at":"2026-08-08T00:38:54.373896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.377234Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.377234Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:670384b2a45461d3a6f7c454f943a3f147cdc745cc8daf219e29081af61214cb","observation_id":"124d17c8-d2f7-4916-aa70-48a6b57d695c","resolution":{"observed_at":"2026-08-08T00:38:54.377234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.380506Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.380506Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:5365699dd8d6d839357cfb7023ea0a45221230a36f713a49f7410219aa7ac547","observation_id":"0308c74e-745e-4bdb-80a9-fc395a666122","resolution":{"observed_at":"2026-08-08T00:38:54.380506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.383895Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.383895Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:014cc338f67e8f894a3bbd99999882f7e811307cb3c3688113c1e920abc5d951","observation_id":"137980d6-499a-466b-8246-37875d31c9a0","resolution":{"observed_at":"2026-08-08T00:38:54.383895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-07T00:15:34.035413Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-08T00:38:54.387173Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.387173Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:01ca8de48671bc3cbb320f0bc8f7343a26154650cf422193c1477a608d3567c3","observation_id":"f48c3caa-2414-4616-9134-fb48b647a39f","resolution":{"observed_at":"2026-08-08T00:38:54.387173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-08T00:38:54.390520Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.390520Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:1768a623589fb9b51e1afc388a31a36ed42174ac94ad5072b439beb4673fef2b","observation_id":"5862b241-aec2-4ec6-929c-eb3016af799b","resolution":{"observed_at":"2026-08-08T00:38:54.390520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05763","last_updated":"2026-06-04T06:44:54Z","snapshot_observed_at":"2026-08-08T06:14:05.969071Z","submitted_at":"2026-06-04T06:44:54Z","title":"M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05763","snapshot_observed_at":"2026-08-08T00:38:54.394031Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.394031Z"},"links":{"cited_paper":"/paper/2606.05763","citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:2da34c714c9aa080c1718758cc91120f19453fd4b7eaa03e7c46d41df1465a6d","observation_id":"90aa7cfb-9ff0-4588-8bc7-9aca6531904e","resolution":{"observed_at":"2026-08-08T00:38:54.394031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.397062Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.397062Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:25f181f9c34fb9b05b1cf9eb885f00ab82574eba4cc9c4e5600451e8209d733b","observation_id":"2524002a-08e6-4e81-966b-538796c011ba","resolution":{"observed_at":"2026-08-08T00:38:54.397062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.400282Z","title":null,"venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.400282Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:7412c1051a21f53323bc3a379f932d2d233b5c6899916391b2ce228656023592","observation_id":"f153512a-cb7b-4cd9-a6db-55261bd5f2c3","resolution":{"observed_at":"2026-08-08T00:38:54.400282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.33044","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.697477Z","title":null,"venue":null,"work_id":"25d05e66-0db8-4585-b370-87ea115b6503","year":2023},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.403395Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:99127c9db813ce3eef6193c555906e73570264e3e503457e7bcb6a3c6c601c37","observation_id":"b0693668-e234-4b58-b3d5-4e5d405ea64d","resolution":{"observed_at":"2026-08-08T00:38:54.704054Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.406547Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.406547Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:b4071aa1423ce5640242bc1d0ca09b22a54a6109979dc034dfbd9e130e2ce0c2","observation_id":"69a62879-b9c3-403c-8956-f050ccbad675","resolution":{"observed_at":"2026-08-08T00:38:54.406547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.409813Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.409813Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:318c9f3c742533e61549343be22d5be1665fc9077397e899aad82962d92af65d","observation_id":"3fa79b04-247c-4abe-bdf6-87be5cef118c","resolution":{"observed_at":"2026-08-08T00:38:54.409813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T06:10:26.085614Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":53,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.03964."}