{"as_of":"2026-08-09T02:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:365b4ce0758808a76ac58cc6c2646012f043dccae3f3fb359f53a4c83667be6d","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:46:04.812385Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:46:04.622698Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T04:46:04.891505Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"cited_work":{"arxiv_id":"2506.09792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09792","snapshot_observed_at":"2026-08-07T04:46:04.891505Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","venue":"cs.SD","work_id":"0f1c2347-fdfe-45af-88dc-a0916ccc9339","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.622698Z"},"links":{"cited_paper":"/paper/2506.09792","citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:06b23d21ab2ca6b20eb8106a9e3513a0f5b90808156b1baf29953bb5be929810","observation_id":"bd51abf4-a74b-46fe-be2e-d77959f7cc4a","resolution":{"observed_at":"2026-08-07T04:46:04.897605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09792/citation-record","integrity":"/paper/2506.09792/integrity","json":"/paper/2506.09792/citation-record.json","paper":"/paper/2506.09792"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.464133Z","title":"Most existing studies focus on improving the audio-visual fusion mechanisms [1, 2, 3, 4, 5] or addressing visual cue-impaired scenarios [6, 7]","venue":null,"work_id":"11f7139e-d64a-4179-aaeb-f825cc9d52e6","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.617264Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:13069b767cc475838b0920102ac254c41ee2e5f3cd7af4d5b5ecbc7e605fefd4","observation_id":"dc2de33d-730c-49d9-8dc4-cc305f4e20d3","resolution":{"observed_at":"2026-08-07T04:46:05.469713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"cited_work":{"arxiv_id":"2506.09792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09792","snapshot_observed_at":"2026-08-07T04:46:04.891505Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","venue":"cs.SD","work_id":"0f1c2347-fdfe-45af-88dc-a0916ccc9339","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.622698Z"},"links":{"cited_paper":"/paper/2506.09792","citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:06b23d21ab2ca6b20eb8106a9e3513a0f5b90808156b1baf29953bb5be929810","observation_id":"bd51abf4-a74b-46fe-be2e-d77959f7cc4a","resolution":{"observed_at":"2026-08-07T04:46:04.897605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.448614Z","title":"Dataset In this study, several experimental settings are considered: •Training Set:A two-speaker mixture training set is simu- lated following previous work [1, 6, 2, 3]","venue":null,"work_id":"286c15cd-442b-482e-9177-767682f41aa6","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.627656Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:1d6c453fb3143c4631054ab90645c816d8c1b060c676d6589076b2b25f4d8a12","observation_id":"bdec9dcb-8ec5-42ea-9e00-963626b2f9bd","resolution":{"observed_at":"2026-08-07T04:46:05.453563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.433994Z","title":null,"venue":null,"work_id":"0fb66702-6a69-4e02-bd90-6414fe21a44b","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.633169Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:c558e624688e3a8d152b1ea6df8583518b8504c961933568a751dccd6ce625f7","observation_id":"6dfff320-741e-4807-8bea-7aaa4718b772","resolution":{"observed_at":"2026-08-07T04:46:05.438722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.419213Z","title":"Full occ","venue":null,"work_id":"99e8b86f-6fe3-4895-a351-3c9ac17a7314","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.638070Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:6af5be7200fb21ed1fed524d36be5d82c92158bcf632d52b87ebcdc910d00863","observation_id":"715afddc-d228-491b-bd38-b22495bee4f9","resolution":{"observed_at":"2026-08-07T04:46:05.423908Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.403465Z","title":null,"venue":null,"work_id":"236b7a2f-27f5-4c97-b96a-206d849b4542","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.643723Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:52ad2c04d5d9c96bd7dad7fd8ed2cea446f7f2439af78583a5abab3a67968324","observation_id":"554b79fa-87ed-4956-9e48-178c2cbd62e7","resolution":{"observed_at":"2026-08-07T04:46:05.408576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.387553Z","title":"62401377, Shenzhen Sci- ence and Technology Program (Shenzhen Key Laboratory, Grant No","venue":null,"work_id":"96679d1a-56a3-40c0-8e69-ccf05fcade9c","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.648600Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:006c7f9db2476c97285a2c00e305209d05d5aa61136ea0399655ebf209c2dbbb","observation_id":"f77eb3b3-5e62-42a7-a8a1-15d631fae36a","resolution":{"observed_at":"2026-08-07T04:46:05.393041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.371925Z","title":"Muse: Multi-modal target speaker extraction with visual cues,","venue":null,"work_id":"81b9e0ea-51cc-4951-880c-41cd449a1752","year":2021},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.653741Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:3bd221e555550eb2e4fe77aed48efb3283a1907ce75765f358b7fa02bfe2a490","observation_id":"277ee2e9-90dc-421c-8b38-bbdb74a5141e","resolution":{"observed_at":"2026-08-07T04:46:05.377153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.357115Z","title":"Av-sepformer: Cross-attention sepformer for audio-visual target speaker extraction,","venue":null,"work_id":"1d2fd2b6-9f30-43a4-8b9f-4d212bb293a8","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.658898Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:947b06085dc4d86501ccf59bf9305fcd2ceddb6aafb414c0cd37a84c452e058b","observation_id":"5ecfee67-d124-4cc9-b4a4-b30340e60df6","resolution":{"observed_at":"2026-08-07T04:46:05.361888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.342016Z","title":"Avhumar: Audio- visual target speech extraction with pre-trained av-hubert and mask-and-recover strategy,","venue":null,"work_id":"18ba1ca4-6159-4991-85d7-f45881b0ba1e","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.663935Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:cf49dbee7ff2f24bb77a9c5f9611d55e858dd3ebed9cee897f09d87c9e0deb55","observation_id":"dc1f0523-48b4-4580-b3cb-863bb54eea93","resolution":{"observed_at":"2026-08-07T04:46:05.347080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.326969Z","title":"Target speech extraction with pre-trained av-hubert and mask-and-recover strat- egy,","venue":null,"work_id":"4cab8719-1a0b-4ae6-99a5-d2cfab92c5cf","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.669226Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:66e90fb86a7291dc5b2ba01dcc2f1b39a11ed39ada001965a3036cb18ad6d7df","observation_id":"e9d1b61d-adb8-4864-84af-404c35a7c337","resolution":{"observed_at":"2026-08-07T04:46:05.331829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.313055Z","title":"c 2av-tse: Context and confidence-aware audio visual target speaker extraction,","venue":null,"work_id":"de5ffac7-b736-46a7-b8ed-b87eaf509340","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.674131Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:af3b2dbd0b4876df9af056325915ecfc615957cf0ab7451e4408dfd2e63b1881","observation_id":"9f2fce59-8df6-46fc-a264-defe611a2a0e","resolution":{"observed_at":"2026-08-07T04:46:05.317657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.298422Z","title":"Imaginenet: Target speaker extraction with intermittent visual cue through embedding inpainting,","venue":null,"work_id":"2169cc6e-55ab-4e07-8ed0-b48a7cc475a1","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.679148Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:d467ebe48022bde273a47166135207e92433103004d365722cf96286809bb35d","observation_id":"fb5b5b21-c426-4760-ba87-16c0ddf158b4","resolution":{"observed_at":"2026-08-07T04:46:05.303072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.282293Z","title":"Restoring speaking lips from occlusion for audio-visual speech recognition,","venue":null,"work_id":"bb0b664f-576a-4281-9149-241ae57e4f4a","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.684022Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:d82f5d53e6b15b69af815f462ea75eae74f335f4f3a302f04a66456cb03585b9","observation_id":"e0ad3710-a4cd-4595-8c2f-a4944678ed28","resolution":{"observed_at":"2026-08-07T04:46:05.287472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.267129Z","title":"Semantic en- coding during language comprehension at single-cell resolution,","venue":null,"work_id":"d29b3535-3e87-4de2-9e5b-ab8178921269","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.689743Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:9f62fe0b28ac7dd7ff208911ce4be16b404fb4b690580bfe527f2c82548e8eaf","observation_id":"1d9e7c30-6caf-405d-8f3f-df8ed062ab1f","resolution":{"observed_at":"2026-08-07T04:46:05.271997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.251398Z","title":"Hubert: Self-supervised speech representa- tion learning by masked prediction of hidden units,","venue":null,"work_id":"dcc5362e-8009-4d1d-b6b5-3683e7c83f0a","year":2021},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.694126Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:2a3df84c4ba35ba854dbde19b46e4e84d6c4eacbd9fcf041185bd32cae74cad9","observation_id":"747ba67d-bf1f-43dd-bba5-3db1cc01ab66","resolution":{"observed_at":"2026-08-07T04:46:05.256584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.236148Z","title":"Large language model can transcribe speech in multi-talker scenarios with versatile instructions,","venue":null,"work_id":"3889caee-0377-49f6-9d89-42136f6b0766","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.698793Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:d040701c94b1c30483d552f168d77672f6777bb4a3c814f9e4812b4c329adec8","observation_id":"ce3d5104-6aa5-4de9-8092-a6289ee7cd5f","resolution":{"observed_at":"2026-08-07T04:46:05.240980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.220684Z","title":"Target speech extraction with pre-trained self-supervised learning models,","venue":null,"work_id":"dd4eb670-ef8c-4821-82b6-afb2c940dd00","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.704344Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:583e14cd75df35a7b60b8a8f8743609018e63c497ebc2a7ab481ce6530379eb8","observation_id":"e133f23a-cfdd-4793-945f-bc8822d23e76","resolution":{"observed_at":"2026-08-07T04:46:05.225837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.205468Z","title":"Probing self-supervised learning models with target speech extraction,","venue":null,"work_id":"591c03a8-4ff9-4b21-939d-ff9035aa6ea8","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.708724Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:01824a9f8b9dbbd46f9682fb33c8da4ad8e823080903218ab6151add025baff9","observation_id":"e15dd3bf-0e42-49e5-aeb5-e76d5bcad2a6","resolution":{"observed_at":"2026-08-07T04:46:05.210381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.189833Z","title":"A large-scale evaluation of speech foundation models,","venue":null,"work_id":"5f342881-95cc-453b-93fc-5ab4284cc97f","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.713437Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:213875abd7e6120a3078ed50b5ea277babc90d0de23613ab3113027af9803ad4","observation_id":"78c595a9-fa23-41e9-b7e4-e1ed7ad327c5","resolution":{"observed_at":"2026-08-07T04:46:05.194831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.174301Z","title":"Transferring knowledge from large foundation models to small downstream models,","venue":null,"work_id":"03b5a2e7-d97d-40eb-a8a0-e7e69e2b729a","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.718269Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:b683b7fccdb302608cb9b19b1637fe1dc926665b08cad7fe785a2fad98729810","observation_id":"a571c4ce-40a4-4f71-b03d-16c5d536b767","resolution":{"observed_at":"2026-08-07T04:46:05.179377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.158263Z","title":"Knowledge transfer from pre-trained language models to cif-based speech recognizers via hierarchical distillation,","venue":null,"work_id":"d33c3d78-5c02-479e-a708-a6bc072c7008","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.723757Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:3429fb5c6a0551df49e3a25c3edb5b2b054604e7523f945a7eeae7b805590cb2","observation_id":"62790262-403f-4144-b32a-f3b86abd677e","resolution":{"observed_at":"2026-08-07T04:46:05.163405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.142015Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":"a19b8e89-ee28-4171-80db-63e3d9c7aa6f","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.728231Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:f03342bfd0448ec34bd895c87d88705bf834ab4003ffc479292290919647cea8","observation_id":"b915031b-a18a-458b-90d7-4e2dd441ec03","resolution":{"observed_at":"2026-08-07T04:46:05.146935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15764","last_updated":"2025-05-21T16:46:32Z","snapshot_observed_at":"2026-07-06T19:36:54.626904Z","submitted_at":"2024-10-21T08:23:31Z","title":"LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15764","snapshot_observed_at":"2026-08-07T04:46:04.733824Z","title":"LSCodec: Low-bitrate and speaker-decoupled discrete speech codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.733824Z"},"links":{"cited_paper":"/paper/2410.15764","citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:6e0ae177347b8cf5a58e8cabd070473def29a1ec6beccb08d0d03b1f01f61076","observation_id":"97115ffb-4df0-4dc0-9975-36526792fae7","resolution":{"observed_at":"2026-08-07T04:46:04.733824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.126655Z","title":"ALMTokenizer: A Low- bitrate and Semantic-rich Audio Codec Tokenizer for Audio Lan- guage Modeling,","venue":null,"work_id":"de5f12b5-45a4-4e0f-b6a8-b75129a54b07","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.738953Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:ce93451a49d67b938870d7159a2e6eba1c47e16591cec7584c921e0971ea89cf","observation_id":"2ddd5d4f-bc6b-4752-958a-3c196629d5fd","resolution":{"observed_at":"2026-08-07T04:46:05.131868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.111088Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"a8a446d2-62c5-473a-b7ef-89c2bd74ff38","year":2021},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.744419Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:5778119079559c9294fd092e6065f9e6a7fd2de85af86b112dc77d31e8db1ea9","observation_id":"4a37c920-5726-402b-9940-466c6bb4effb","resolution":{"observed_at":"2026-08-07T04:46:05.116365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.095554Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":"80447af0-9336-47c0-9257-3584de4af2e3","year":2019},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.749038Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:327d005dc1efe71e94dcf39300d06b1bff6bd0ededac6cfa8dc68e3f5869c2c8","observation_id":"c2378fd2-e3ac-4f81-96a9-249ff3ea9aac","resolution":{"observed_at":"2026-08-07T04:46:05.100660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.079479Z","title":"Separate in the speech chain: cross-modal conditional audio-visual target speech extraction,","venue":null,"work_id":"6500dd76-95d8-413d-ab57-70bbbc52bf1d","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.754727Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:f38f87998b7c05f2035426999520299f92ea0e16a25cb926dea14e93e67f3278","observation_id":"cccba63c-671b-4ce4-a72c-1fa36577a663","resolution":{"observed_at":"2026-08-07T04:46:05.084425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.759101Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.759101Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:6e4510586e7d1dfd78511e7f886179ebe57a6fd60051486f0a09480b8c6b1e4b","observation_id":"9e63d60d-5eac-43ff-b8f5-113ff6fe942a","resolution":{"observed_at":"2026-08-07T04:46:04.759101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.052879Z","title":"Watch or listen: Ro- bust audio-visual speech recognition with visual corruption mod- eling and reliability scoring,","venue":null,"work_id":"cec315a3-2f96-4706-9d7c-2d68bb84abd5","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.763651Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:9adfe01bee223b2b600805bd2fd62bcd756d19a95342cf486b92656c8a3e72cf","observation_id":"cf384b2e-344f-4da7-a016-6670a52231d2","resolution":{"observed_at":"2026-08-07T04:46:05.058171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.037528Z","title":"Lrs3-ted: a large- scale dataset for visual speech recognition,","venue":null,"work_id":"4ef07974-cf5c-4169-ae26-14b1c6de627c","year":2018},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.768090Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:d2be8941aab8259653b95f3741f81f67b9e2f94d0411af310b8e9178247c749b","observation_id":"8f3733b2-e3a8-4f34-9193-24faa3e99dcd","resolution":{"observed_at":"2026-08-07T04:46:05.042463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.022391Z","title":"Sdr – half-baked or well done?","venue":null,"work_id":"143f37dc-86a5-4d66-935d-d111431c5005","year":2019},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.773088Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:1ba68af64b972e02925618ab543f7ec808011131bbb417291ea13056593f67ac","observation_id":"df70e485-3872-4cd2-b00f-2584726a6d38","resolution":{"observed_at":"2026-08-07T04:46:05.027505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.6350","last_updated":"2012-12-27T11:31:16Z","snapshot_observed_at":"2026-07-06T03:02:52.979669Z","submitted_at":"2012-12-27T11:31:16Z","title":"Single-sided Real-time PESQ Score Estimation","version":1},"cited_work":{"arxiv_id":"1212.6350","doi":null,"metadata_source":"pith","pith_arxiv_id":"1212.6350","snapshot_observed_at":"2026-08-07T04:46:04.849447Z","title":"Single-sided Real-time PESQ Score Estimation","venue":"cs.SD","work_id":"66788e45-1806-4c1e-b5af-4302a25d0b55","year":2012},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.777432Z"},"links":{"cited_paper":"/paper/1212.6350","citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:17ec07687ea26f04a0b8e4a4dbc08e1a2ad491359d7432b9187845ef6d35a936","observation_id":"d35c370d-25fb-4aa2-92c0-6f0d5cbb1174","resolution":{"observed_at":"2026-08-07T04:46:04.857164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.006180Z","title":"An al- gorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"96192bf6-30cf-4bcd-b453-51517c84ff90","year":2011},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.782208Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:3a31ea44676fe3d156e67975768b9a06ecca4d75c1f3ee22a3f7b2a28a71ea0a","observation_id":"d0040916-1427-4b42-8027-a37154c8e2ae","resolution":{"observed_at":"2026-08-07T04:46:05.011753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.990962Z","title":"SpeechBERTScore: Reference-aware automatic evaluation of speech generation leveraging nlp evaluation metrics,","venue":null,"work_id":"d1861b50-5ecb-422d-9739-9505473605e3","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.787637Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:32a1cda47d625bbe351b493df00bff1687388bb144fb39c022dc6c8f61ffe072","observation_id":"2feebede-1b54-43ca-a246-0f0eb293d75e","resolution":{"observed_at":"2026-08-07T04:46:04.995934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.973642Z","title":"How should we extract discrete audio tokens from self-supervised models?","venue":null,"work_id":"133e3f8f-8225-4cda-ba4b-ec4f4bf384ef","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.792441Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:0982b4191a0dea925ebce64004b851b17515e3064bdf6b891280b918bf2d1646","observation_id":"e82f49b8-00ac-4725-ad93-a1c3d3503b1e","resolution":{"observed_at":"2026-08-07T04:46:04.979381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.957843Z","title":"Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"830d441a-f1cc-47e7-9b4e-59dd1882c865","year":2006},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.797897Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:3ca1d74ce784be38932f13d6ddb42e73ce27074fa502b1291c5693dba7603680","observation_id":"673af5ad-5b81-4606-a91d-8a5f8194060c","resolution":{"observed_at":"2026-08-07T04:46:04.962900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.941423Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"e0aba799-e51c-4fc6-a183-c91d951e18dd","year":2020},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.802382Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:e68461965ddea11c5f140abd952be1c0a48aba65b7cd6eb7a501a1766f44935e","observation_id":"5426972f-cbe5-4462-b88d-d586d4b961b1","resolution":{"observed_at":"2026-08-07T04:46:04.946664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.924512Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"c2a69ac9-2cba-4051-b092-ca8d1444394f","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.806966Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:edb580c63edc7f9e4fdd746b911368efcee15daa56d8c8c93321ee414a33062d","observation_id":"c5af5730-58c1-48f1-870e-a77dab4ef6d3","resolution":{"observed_at":"2026-08-07T04:46:04.929645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.908698Z","title":"Intuitive multilingual audio- visual speech recognition with a single-trained model,","venue":null,"work_id":"80909ba6-25a4-4d96-b0e7-c17275c61bfe","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.812385Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:f9218cc8f27011efc0ce17eb244c5b7aa87fc88395693eddeced01293a495ed0","observation_id":"4ac4cd68-4834-42c4-8b31-c4753ab3a989","resolution":{"observed_at":"2026-08-07T04:46:04.913816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2506.09792."}