{"as_of":"2026-08-07T09:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e1e3d085965b1d2af98f4a8570f28f2fb4f5aec4334ef30b8f58945031534db","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T23:17:45.299833Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T23:17:45.299833Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T22:49:01.384665Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"cited_work":{"arxiv_id":"2606.23712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.23712","snapshot_observed_at":"2026-07-03T22:49:01.384665Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","venue":"eess.SP","work_id":"ceefdbb9-e54e-491c-8cbd-5973fd1ddb5c","year":2026},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/2606.23712","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:87c4853963e199c81fc96940bcd3e8df0efbcf3c554d1e802a6e98520529b571","observation_id":"89dbd48a-c87c-4bca-acaa-4f190bf0b482","resolution":{"observed_at":"2026-07-03T22:49:01.387089Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.23712/citation-record","integrity":"/paper/2606.23712/integrity","json":"/paper/2606.23712/citation-record.json","paper":"/paper/2606.23712"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Recent deep learn- ing approaches have significantly improved performance [1–3], with generative modeling frameworks emerging as a powerful direction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:4d125c59411005ab760b5dbc37fa4211e36fa9d403b40ac196b83088f7031923","observation_id":"5deb219c-beb9-49e1-b4f4-5d425e4dabe3","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"cited_work":{"arxiv_id":"2606.23712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.23712","snapshot_observed_at":"2026-07-03T22:49:01.384665Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","venue":"eess.SP","work_id":"ceefdbb9-e54e-491c-8cbd-5973fd1ddb5c","year":2026},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/2606.23712","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:87c4853963e199c81fc96940bcd3e8df0efbcf3c554d1e802a6e98520529b571","observation_id":"89dbd48a-c87c-4bca-acaa-4f190bf0b482","resolution":{"observed_at":"2026-07-03T22:49:01.387089Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"1, describing how the audio-visual con- trastive loss is computed and the motivation behind it","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:7131629ab46d8d5e5ce418484f66a3e9841b1f2e8c5bba6d56f19af388181512","observation_id":"a9516dbd-c7dc-4cc8-9b84-34a969b732b5","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"As baselines, we con- sider A V-DiffUSEEN, with cross-attention fusion [8, 13], the audio-only version, AO-DiffUSEEN [13], and the supervised- generative FlowA VSE model [7]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:ca8518939458ac03e15caf9655bfadeb8a641218ffa940cb8e91f84b0c84582e","observation_id":"29ed98d9-149b-47af-ad22-c702fad92144","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Matched condition: TCD-DEMAND Under matched conditions (Table 1), the proposed model im- proves all metrics compared to A V-DiffUSEEN","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:bd7136a29782621996c05ba2e5942ec7455f56d4b36b881ab49cba9304c22450","observation_id":"78d6f946-dbcc-498e-a989-35221d479999","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"During the pretraining of the visual-conditioned speech diffusion model, we augment the denoising score matching ob- jective with a contrastive audio-visual alignment loss","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:3eeb26736c0d52b1efcaffc16db85473ca0cb8bc385ad6c66524f50eee48cf40","observation_id":"524e131a-c194-485f-a7c3-9ed5ce3046b2","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:6c7b99cd956752ef7d8841574294367c250c30a661f29fd63219bbd4f043eab1","observation_id":"a8dccfb8-f91f-46f7-82d7-19fd41abd647","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Generative AI tools were only used to edit and polish some portions of the manuscript","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:7f9487fccfba62675dd8263fee943b2ffb767236216f3c9b2f9fc6601388ca45","observation_id":"abe0aa72-a4df-4085-a5ff-2157cc113e88","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"SEGAN: Speech enhancement generative adversarial network,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:80e1293cf50a43da3ea57c3832d0954ea0576e3fb4b480f7e7a3c4f1f9c3b83c","observation_id":"bc98de02-c35e-4519-9557-50233c8b473a","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Conv-TasNet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:6cd3cfc267188422c16aa88928bc99e7b549f890965cb29ebab1ebd5733c2d65","observation_id":"42c0a82b-ce2c-4996-9b44-0c0f8463d353","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"DCCRN: Deep complex convolution recurrent network for phase-aware speech enhancement,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:982d08eebbe36d6a50d761cbc4f9dc4592f6902223f1affda3e025b7f8427490","observation_id":"7836dbb8-7d74-40fb-ae77-af0bb744b29d","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Speech enhancement and dereverberation with diffusion-based gen- erative models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:ac3f4a23728422c575369ea295fa439caabc4b02a45fa31979aeda7150cef081","observation_id":"7e54e6c0-1e8e-4fe8-9274-037b1169f730","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"The conversation: Deep audio-visual speech enhancement,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:5574511e33434c78bc9bc80664b0720bcede66da9836b1f579d8d356aef5d631","observation_id":"ccded98c-1c52-4c7c-a183-7c800ab26646","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Audio-visual speech enhancement using multimodal deep con- volutional neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:2857e4eebebb3d3b38550bd1eecb02baf4888fc2693689fd438ea5d52f1b258e","observation_id":"6e168e88-24da-43a7-9283-ded77279913f","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"FlowA VSE: Efficient audio-visual speech enhancement with conditional flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:53e84aafccb96319ccfab414f585338bea853d7da22d385566a19d7a49649a92","observation_id":"2fa0d510-f391-4a3f-97a8-4915a7be2514","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Diffusion-based unsupervised audio-visual speech enhancement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:d165d0f48e96b4fcd8d107e4dce5b6d75486d7b1fe207a66570ffb00cbadadab","observation_id":"0c7e79e7-2730-4bf5-a57d-4f0ba8828a25","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"An overview of deep-learning-based audio-visual speech enhancement and separation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:303030881aa8b8da575a056f64aa2bc603e64589c603cb2e188e6ea73f83735a","observation_id":"00df5926-de7b-48df-95f8-0b002ed8d94a","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Learning transfer- able visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:36fd81d30c730522eecddf535494a4472a7eb331da4a4b6cd45787fcc94c9a49","observation_id":"3b129cf7-9d46-4a10-83dc-ebecdac0bbec","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"CLAP: Learn- ing audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:e06f6cd08ea7625e36b10e7a9946a7e926835ac93665cec7127114bf0b4774b5","observation_id":"3ed6430b-a876-42ef-a7b3-fc3397cc4d8c","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"SA V-SE: Scene-aware audio-visual speech enhancement with selective state space model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:434941894ed514d5f900b7fb61ad26d6042c5c03eb9cbd249a708245b96e1bd5","observation_id":"032e5418-8cae-463e-87a7-1922dc297312","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09931","last_updated":"2026-05-23T22:38:42Z","snapshot_observed_at":"2026-08-03T10:29:45.226942Z","submitted_at":"2026-01-14T23:25:56Z","title":"Diffusion-based Frameworks for Unsupervised Speech Enhancement","version":4},"cited_work":{"arxiv_id":"2601.09931","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.09931","snapshot_observed_at":"2026-07-03T22:49:01.370716Z","title":"Diffusion-based Frameworks for Unsupervised Speech Enhancement","venue":"cs.SD","work_id":"038324f7-514b-459e-8ea8-196a07705068","year":2026},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/2601.09931","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:7702eb7ce4c14c107be7da5986437edabf1d74615b821decf9fc6b23612f9701","observation_id":"f9107a07-13aa-4db5-aaa1-dd0767c09fdb","resolution":{"observed_at":"2026-07-03T22:49:01.372695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Score-based generative modeling through stochastic differ- ential equations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:18b04882661d9f19230a77bf8789f7fb829904ea880580dbe286d718d0d4cd7b","observation_id":"9ec4f8fc-b3ab-4292-9e12-fb2a8417dbf2","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Nonnegative matrix factor- ization with the itakura-saito divergence: With application to music analysis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:40de59fb3211e2351032b7b98d444a9fe56049b7817b67088493ebe54d086be2","observation_id":"4ad42cd0-8bd9-49ef-ac26-3299a6263287","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Tweedie’s formula and selection bias,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:db7a3531c081caaa96ad631e80f5397a1ac306df771b9103944284874260d018","observation_id":"4637457c-8421-4014-a872-d69d9cc1cda5","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Deep residual learning for im- age recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:657dac0bd6db7cd89d1e0552134d06be65d9dd4fd6a9c9a9bd8f9005d45be393","observation_id":"eea11571-501f-4479-acdc-02b3503f7786","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-07T00:15:34.035413Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":"2201.02184","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-07-04T08:49:41.728084Z","title":"Learning audio-visual speech representa- tion by masked multimodal cluster prediction","venue":null,"work_id":"2e8fb221-cf84-40aa-a1b3-76de79871327","year":2022},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:46c37b32f1c248e0540c53b442ab54f8d7bbc0e77f40df7fb5f25d2be616f9b1","observation_id":"524a6f4f-0fc6-4ba4-a4ca-47e4a843d284","resolution":{"observed_at":"2026-07-03T22:49:01.368464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:fd3933534a8104e39e5869e49f22f7fb2c0e31432b3c484d56332307152f9788","observation_id":"7d69518e-b9cd-4010-9d25-aa3d18057d95","resolution":{"observed_at":"2026-07-03T22:49:01.377870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"TCD-TIMIT: An audio-visual corpus of con- tinuous speech,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:767823c10a272da2bc6d85f55ac18786fbd41a20d6edc87da2b6262ce86d5447","observation_id":"fcbf7481-a563-4ee6-a647-5048a5bc8b76","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"The diverse environments multi- channel acoustic noise database (DEMAND): A database of multi- channel environmental noise recordings,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:dfb7d5e968c82cf569c59d34ad11b6c3f80a05ad7c6013934e8a1ccb41c359ac","observation_id":"320a8621-46b7-4b0d-8d90-173f4644e06e","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":"1809.00496","doi":"10.48550/arxiv.1809.00496","metadata_source":"pith","pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","venue":"cs.CV","work_id":"2f4e32b3-48a5-4b83-946d-739ea8df5168","year":2018},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:f6c45eca63019005f341e906247a1b2bae7674e74fa93306bd63f1100051fd34","observation_id":"63597d9c-061d-4644-930c-d95d8a30ea95","resolution":{"observed_at":"2026-07-03T22:49:01.382024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"NTCD-TIMIT: A new database and base- line for noise-robust audio-visual speech recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:b9d6e7fe7fdb426305eda4f3fdb505fee8897a00466424971458f0a82e0b80db","observation_id":"7016b475-36d9-4462-bdd4-24d74b2ec68b","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"SDR–half- baked or well done?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:c0de6a42bc26260b4f2f20d7d8da7f890cc9287347dc4fc58bafa6af622857b1","observation_id":"709ebb50-95b1-4e58-b620-921464db7ada","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Performance measure- ment in blind audio source separation,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:180f92700a66d7f4163dadb98533d8a804c49776fc0c68acf53dde1d81989b10","observation_id":"bcd495df-920c-485f-85e3-ddb03a86f8fc","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:b646984b3339f24c9a0a934ff62d8987875838603c4ab22770125371d2e20454","observation_id":"272ef1c0-95a9-4e6f-a1f0-8d00467d0975","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"An algo- rithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:bc57f889469e8e9c55d5d064114d70d24c75421a04ae5736f4c4f8c80ef34b5c","observation_id":"0983f300-b362-4d03-a785-f905f04a78b2","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","latest_version":1,"primary_category":"eess.SP","snapshot_observed_at":"2026-08-02T16:23:06.121471Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2606.23712."}