{"as_of":"2026-08-08T15:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1765665c18ce2099fc98e54888b0301d8ac365068ec69824950b772e55c1cce5","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T12:54:17.490105Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08111/citation-record","integrity":"/paper/2607.08111/integrity","json":"/paper/2607.08111/citation-record.json","paper":"/paper/2607.08111"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.04826","last_updated":"2019-06-19T17:10:51Z","snapshot_observed_at":"2026-08-02T02:00:03.822386Z","submitted_at":"2018-10-11T02:57:14Z","title":"VoiceFilter: Targeted Voice Separation by Speaker-Conditioned Spectrogram Masking","version":6},"cited_work":{"arxiv_id":"1810.04826","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.04826","snapshot_observed_at":"2026-07-10T12:57:07.589361Z","title":"VoiceFilter: Targeted Voice Separation by Speaker-Conditioned Spectrogram Masking","venue":"eess.AS","work_id":"41c90163-d0d3-450b-849c-9bc354214ad8","year":2018},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/1810.04826","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:f943b5ba6e52262745db251c75004d97fb21a7fe5bd39ff3d0a56f286e6996f9","observation_id":"d2f01861-67ed-4bcc-9e2f-22a0fc83e479","resolution":{"observed_at":"2026-07-10T12:57:07.591118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.730711Z","title":"Speakerfilter: Deep learning-based target speaker extraction using anchor speech,","venue":null,"work_id":"681b86fa-8b75-4fb1-96d3-f489769c8ba3","year":2020},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:c4ee212dcf51c7430f9e3ce498e79d9e8a636fe23bd9c606954bdc1fa6e20c33","observation_id":"97511a37-16b3-4bdb-b48b-cc998df44de2","resolution":{"observed_at":"2026-07-10T12:57:07.731870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.752951Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":"f98774f0-3428-42fd-9942-be64fe0af423","year":2023},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:c0777c6a28120c5da67070ed74ab1205cb60b22f227d1aea8c7a90f71e2e0dee","observation_id":"a6d5d5d7-6341-42d4-945e-dfbd1d71960c","resolution":{"observed_at":"2026-07-10T12:57:07.754105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.729052Z","title":"Multimodal attention fusion for target speaker extraction,","venue":null,"work_id":"37711052-15c3-4ee2-ae5a-3cd73e3e50da","year":2021},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:921f30357c307b15c3619d5f36b787ce8c37da0ccc3a61113e2a3b81c373d80c","observation_id":"e6a1fbaa-405b-4d83-b31e-6448ab2068e1","resolution":{"observed_at":"2026-07-10T12:57:07.730190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.747816Z","title":"Improving curriculum learning for target speaker extraction with synthetic speakers,","venue":null,"work_id":"83576d25-d9c1-4db4-959f-83b833fe4e04","year":2024},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:661569de71d885ae7a71b247fb0a2d7ac1139b1a5e301cbc12e8df62a6b638d7","observation_id":"6c60e289-7a5d-4e25-b9b2-f444a8621ba6","resolution":{"observed_at":"2026-07-10T12:57:07.749000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.754655Z","title":"Conv-tasnet: Surpassing ideal time– frequency magnitude masking for speech separation","venue":null,"work_id":"830e5cca-3519-4c59-9e59-22b4a11a5540","year":2019},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:f95a600d77db97b9372f1866dab49dab045796fc538fd4e0c118f0caea843aeb","observation_id":"6ca1e4a0-0ea6-4acb-9374-b6549f135a8c","resolution":{"observed_at":"2026-07-10T12:57:07.755891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.756451Z","title":"Dual-path rnn: Efficient long sequence modeling for time-domain single-channel speech separation,","venue":null,"work_id":"87403b40-256d-4082-9247-23043a54a35a","year":2020},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:df3f3ab42586aaf0bde1cef81f4ca91eccc1d486956a1ad1518b204cccefe34a","observation_id":"7b9a6719-2df7-4be1-9dba-ac3334696b63","resolution":{"observed_at":"2026-07-10T12:57:07.757677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.732434Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":"01303be3-df5c-4d2e-a253-529a4ccc975e","year":2021},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:89791a08c4746d4b720433035c5af8d6652dab53a2462b0e4caab0ad7aa8da99","observation_id":"88fd459b-bb2e-4b91-8cb8-6158bf2d9d6b","resolution":{"observed_at":"2026-07-10T12:57:07.733619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.735844Z","title":"Usef-tse: Universal speaker embedding free target speaker extraction,","venue":null,"work_id":"18e8231e-6dfe-4b2e-a8f5-ec5c46e80dd6","year":2025},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:5960069bb946c75896f569d41f9525b36899a66ee2af942b31bf769c61cb372a","observation_id":"554a92f9-10f1-40d3-aa59-329714754699","resolution":{"observed_at":"2026-07-10T12:57:07.737022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.740957Z","title":"Mc-lext: Multi-channel target speaker extraction with onset-prompted speaker conditioning mechanism,","venue":null,"work_id":"152e62bf-90ee-4922-a016-fa76ab0b8d68","year":2026},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:df878ba09f5397b398e127c0f6b23591bcd9d0da5e048faf6e825d0857628943","observation_id":"b0b89346-19b4-42e1-aa2f-9a012d5cdb37","resolution":{"observed_at":"2026-07-10T12:57:07.742181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-08T04:51:01.052037Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":"1706.08612","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-07-10T15:47:23.359432Z","title":"V oxceleb: a large-scale speaker identiﬁcation dataset","venue":"cs.SD","work_id":"24233098-118b-4164-aa92-a86ff8eaf0f9","year":2017},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:1ffc075f9321c8fa52e9c908adda0653c26cdde77f42958cf842027bb774bc55","observation_id":"3b0eaae2-912c-49b4-9964-ba0ed5944056","resolution":{"observed_at":"2026-07-10T12:57:07.585404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.749532Z","title":"Deep clustering: Discriminative embeddings for segmentation and separation,","venue":null,"work_id":"5651994c-836f-4bb8-a15e-13e96ea45b82","year":2016},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:faa86ddc7505cf69700878025253fb13844f66f35805bfe0ac1ba6a1f1ff1ec6","observation_id":"6526d0f5-f666-43ac-8e52-b41e47a769a1","resolution":{"observed_at":"2026-07-10T12:57:07.750695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:9577dc21aea964025379fbf2093239151543314d99f91c0e9a62c6624a6635f6","observation_id":"d613abed-a7c3-418e-9e39-ea4a1dba0775","resolution":{"observed_at":"2026-07-10T12:57:07.568338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.734168Z","title":"The ami meeting corpus: A pre-announcement,","venue":null,"work_id":"608c30d3-80bd-4cd9-9afd-7843685b7fc0","year":2005},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:f019e0f69c8845eb85829d14d6e4fda3240c2808d7249fd19b51d290667568ca","observation_id":"a362931b-6417-4c0f-92aa-83ee938b679b","resolution":{"observed_at":"2026-07-10T12:57:07.735283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.727342Z","title":"M2met: The icassp 2022 multi-channel multi- party meeting transcription challenge,","venue":null,"work_id":"36f50fc4-66a4-4b27-8644-63fde86ef91f","year":2022},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:7693ab25ba80c161bc06966d5d006aa6d2b9fec27c4bd65d29c579414c5cb3a6","observation_id":"0fd5958d-17ca-4604-9ac3-e28a0335e2e5","resolution":{"observed_at":"2026-07-10T12:57:07.728511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09249","last_updated":"2020-05-02T11:04:49Z","snapshot_observed_at":"2026-08-06T07:30:18.680662Z","submitted_at":"2020-04-20T12:59:07Z","title":"CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings","version":2},"cited_work":{"arxiv_id":"2004.09249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.09249","snapshot_observed_at":"2026-07-10T12:57:07.572665Z","title":"Chime-6 challenge: Tackling multispeaker speech recognition for unsegmented recordings","venue":"cs.SD","work_id":"a2ef8f28-2b99-4969-a5ff-d4a6d7b148de","year":2020},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/2004.09249","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:bd50b474a5eae9ae62ae78ef210f2996fed8a7b72acc1de4824eafef86b058d3","observation_id":"79cf3135-7a32-4bbe-ab95-7073fe312917","resolution":{"observed_at":"2026-07-10T12:57:07.574165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03603","last_updated":"2021-08-10T09:15:00Z","snapshot_observed_at":"2026-07-06T10:57:34.353038Z","submitted_at":"2021-04-08T08:38:44Z","title":"AISHELL-4: An Open Source Dataset for Speech Enhancement, Separation, Recognition and Speaker Diarization in Conference Scenario","version":4},"cited_work":{"arxiv_id":"2104.03603","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.03603","snapshot_observed_at":"2026-07-10T12:57:07.581292Z","title":"arXiv preprint arXiv:2104.03603 , year=","venue":"cs.SD","work_id":"bccb28a0-3e6d-4abc-8d7e-ef7d6217badc","year":2021},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/2104.03603","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:92c1dcfbfb7cc065ca58a3f3a3b943665e974c1b6828ba81bb5db660d19842e8","observation_id":"463ff111-9c44-4383-a0b0-a1f9f4f62edb","resolution":{"observed_at":"2026-07-10T12:57:07.582762Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.13447","last_updated":"2019-09-30T04:15:59Z","snapshot_observed_at":"2026-08-03T16:31:28.875444Z","submitted_at":"2019-09-30T04:15:59Z","title":"DiPCo -- Dinner Party Corpus","version":1},"cited_work":{"arxiv_id":"1909.13447","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.13447","snapshot_observed_at":"2026-07-10T12:57:07.578568Z","title":"DiPCo -- Dinner Party Corpus","venue":"eess.AS","work_id":"dde708e7-95c0-4460-8b68-3abe44dd9816","year":2019},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/1909.13447","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:60f59e07df92c0629f24031a636e6c94adf62b3741db3a962cdd48c09690b7e6","observation_id":"a965f09c-fb7b-4f3b-9762-05ea6ef3bf37","resolution":{"observed_at":"2026-07-10T12:57:07.579924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.746040Z","title":"REAL-T: Real Conversational Mixtures for Target Speaker Extraction,","venue":null,"work_id":"f7f5883b-3f92-4317-9b5a-7868c7ed08b0","year":2025},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:cf6db303397a69abd20770a82008a46b0e218d9170fd5ada8ba2d94cd6b40ede","observation_id":"ad7f40aa-4115-4d27-a109-d67dfbb693c7","resolution":{"observed_at":"2026-07-10T12:57:07.747258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.744400Z","title":"Sdr–half-baked or well done?","venue":null,"work_id":"e185c769-875f-4810-a227-f88fd278706a","year":2019},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:5305186e38ca4e4f44849e416b2f82f62217dae08b1af992a325ea9aa9aad1ff","observation_id":"57a8e247-aafe-4edc-bc59-7bcd318aac71","resolution":{"observed_at":"2026-07-10T12:57:07.745482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.742732Z","title":"A statistical model-based voice activity detection,","venue":null,"work_id":"29866df5-6584-48e2-b420-265d92a28bb6","year":1999},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:9d5fcceea300cc0bad9142cd50300bb2e5297229883e38e94fc4f0b4e68d1a77","observation_id":"1dda5e59-a9cc-494a-a3ed-6354d203b409","resolution":{"observed_at":"2026-07-10T12:57:07.743883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:0d184ed6a8cf8489a54568da32d53b3b31684c5704aed33e6e05b0041eb81776","observation_id":"a808baec-1e83-4c55-9f59-4a11deff5b02","resolution":{"observed_at":"2026-07-10T12:57:07.588117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00406","last_updated":"2023-06-06T05:30:55Z","snapshot_observed_at":"2026-08-02T09:31:51.932598Z","submitted_at":"2022-12-01T10:18:54Z","title":"High Fidelity Speech Enhancement with Band-split RNN","version":2},"cited_work":{"arxiv_id":"2212.00406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.00406","snapshot_observed_at":"2026-07-10T12:57:07.564074Z","title":"High fidelity speech enhancement with band-split rnn","venue":"eess.AS","work_id":"4eb8f290-d35d-4033-8159-c71067ca25ce","year":2022},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/2212.00406","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:76c4437add8759f1f979ca0e96daed4558e55301a290cf89edacef8340a1e4ee","observation_id":"f2a0fbfe-7974-44d5-b8ca-4a57a5ac6841","resolution":{"observed_at":"2026-07-10T12:57:07.565527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":"2005.07143","doi":"10.48550/arxiv.2005.07143","metadata_source":"pith","pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","venue":"eess.AS","work_id":"45c323c0-4c7b-4c68-9f61-82af9cce05aa","year":2020},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:7f978f6e8226d5b0c76f22ed696f1ae843287f89968e9bf6b0f9d581809506de","observation_id":"92e32f92-5497-4c58-a268-ba1c521a3fa8","resolution":{"observed_at":"2026-07-10T12:57:07.596894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.739242Z","title":"Cross-entropy loss functions: Theoretical analysis and applications,","venue":null,"work_id":"6a014600-4efa-44a7-8d5c-defe7f235b6c","year":2023},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:c0572f2dc3751de4dc4dc551e148fd6797ce0fcbb4f2f17c4f8e92cf8a97f7f7","observation_id":"117291d4-408e-4a68-aa7a-cfefd13098a1","resolution":{"observed_at":"2026-07-10T12:57:07.740393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.737552Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":"df2e4b18-0315-4800-8c93-ff45a9da3f2f","year":2023},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:8e93d3b8fe8b7d2acbd1de65b286d7d038aacc0fddb06de4c2e2be4faaa6cfd4","observation_id":"a4c1081b-c9f1-41f6-b031-f824b2c33f27","resolution":{"observed_at":"2026-07-10T12:57:07.738715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:57:07.751244Z","title":"Dnsmos: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"5c415eda-e7f4-4808-8f9e-bc0d54c19c93","year":2021},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:fec0a72b2f1af6355619c457f0ba07473639d9479fb43c537be24820b95d268e","observation_id":"46ebe8a1-5261-487f-ac1b-0622096fc1b0","resolution":{"observed_at":"2026-07-10T12:57:07.752411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08138","last_updated":"2020-05-17T00:41:22Z","snapshot_observed_at":"2026-07-06T09:20:58.396174Z","submitted_at":"2020-05-17T00:41:22Z","title":"An Open source Implementation of ITU-T Recommendation P.808 with Validation","version":1},"cited_work":{"arxiv_id":"2005.08138","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.08138","snapshot_observed_at":"2026-07-10T12:57:07.569668Z","title":"An open source implementation of ITU-T recommendation P.808 with validation.CoRR, abs/2005.08138","venue":"eess.AS","work_id":"6335edbf-591e-4bd7-ba87-1592d5c51777","year":2020},"citing_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T12:54:17.490105Z"},"links":{"cited_paper":"/paper/2005.08138","citing_paper":"/paper/2607.08111"},"observation_digest":"sha256:2f284bba9accb81dd461903a6c19ade7b306f7ab221071d5cd719a77e62ddd0f","observation_id":"855dc388-b15c-4da1-8957-6444778d835e","resolution":{"observed_at":"2026-07-10T12:57:07.571418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":18},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2607.08111."}