{"as_of":"2026-08-08T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94902ccf065c1655b0c6b36823070b2af0dbcd435f31632ec9627d86e5079bc8","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:44:17.699820Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:44:17.585344Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:44:17.756531Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"cited_work":{"arxiv_id":"2506.01483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01483","snapshot_observed_at":"2026-08-07T11:44:17.756531Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","venue":"eess.AS","work_id":"966030d1-4dbf-4a71-945a-f7929a254e18","year":2025},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.585344Z"},"links":{"cited_paper":"/paper/2506.01483","citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:a6eab36ca58fa2a5c6a626327fab717a3b9de4783bd093009ed858f49059e5de","observation_id":"c64d3cd2-96aa-445d-9a17-58490363c07c","resolution":{"observed_at":"2026-08-07T11:44:17.760188Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01483/citation-record","integrity":"/paper/2506.01483/integrity","json":"/paper/2506.01483/citation-record.json","paper":"/paper/2506.01483"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.041100Z","title":null,"venue":null,"work_id":"509b6ba3-1f52-435c-be22-28faf0f9e03d","year":null},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.581289Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:152d2c01c3466bb140c7adde328bcb8ee1f6fa64729964b521135fa86df63579","observation_id":"fb41484a-df58-4fb1-89de-5740d92e6d9b","resolution":{"observed_at":"2026-08-07T11:44:18.043532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"cited_work":{"arxiv_id":"2506.01483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01483","snapshot_observed_at":"2026-08-07T11:44:17.756531Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","venue":"eess.AS","work_id":"966030d1-4dbf-4a71-945a-f7929a254e18","year":2025},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.585344Z"},"links":{"cited_paper":"/paper/2506.01483","citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:a6eab36ca58fa2a5c6a626327fab717a3b9de4783bd093009ed858f49059e5de","observation_id":"c64d3cd2-96aa-445d-9a17-58490363c07c","resolution":{"observed_at":"2026-08-07T11:44:17.760188Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.031182Z","title":"Please extract the female speaker with a quieter loudness in the audio","venue":null,"work_id":"0a635d8e-be7b-4ad7-a81c-dfe1f54488c6","year":null},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.589425Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:3ca159c3a8bd34e02715235e693a680da2e0fbb56e79d300082579a966cfcc8a","observation_id":"babad434-68bc-4685-944a-4d52c81539a4","resolution":{"observed_at":"2026-08-07T11:44:18.034941Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.022052Z","title":"Experimental results suggest the effectiveness of incorporating multiple cues and leveraging pre-trained representations from WavLM Base+ CNN encoders","venue":null,"work_id":"01013806-80e3-4353-9869-218c03561f2e","year":null},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.593170Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:bfd2fcfa5de44f8c06706078c108bb6bf0dad732f86462852d3727c4d5a39109","observation_id":"60b3db4a-a405-432c-9af9-88c876226531","resolution":{"observed_at":"2026-08-07T11:44:18.025830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.012516Z","title":"V oice- Filter: Targeted V oice Separation by Speaker-Conditioned Spec- trogram Masking,","venue":null,"work_id":"9cdf925d-72a3-4cfe-a8fa-8c9f1a9b835b","year":2019},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.596255Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:35e30c88925c421cb86167dd080841e490e37ceaa23683d390b40f2a9417dac7","observation_id":"b11bf706-96fa-45b1-9294-8562e63a0a74","resolution":{"observed_at":"2026-08-07T11:44:18.015840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.599677Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.599677Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:e10e674b17d69eb2cc001efbd60d89a3d25c5fd58b43333794dae47caa3d092e","observation_id":"8b6512fd-25f8-4881-99b7-360a0062ca7e","resolution":{"observed_at":"2026-08-07T11:44:17.599677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.995251Z","title":"L- spex: Localized target speaker extraction,","venue":null,"work_id":"24990d51-7989-4567-9d26-d6076b88086b","year":2022},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.602992Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:88e2fd08bec4d61c71322b179e736268581e45f08735d4e98f2ababf7d2b1e09","observation_id":"e106277c-26b0-4167-bf44-d8ecc20bcab4","resolution":{"observed_at":"2026-08-07T11:44:18.001528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.985654Z","title":"Multimodal speakerbeam: Single channel target speech extrac- tion with audio-visual speaker clues","venue":null,"work_id":"3cb671fa-c2d8-4d8c-b4e3-c9669f881c95","year":2019},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.605947Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:df8ad8273897017671260cfd6e7ebe8f9765fe21be62535d239d18b2b851aa12","observation_id":"08960729-baff-44b3-a002-e09659153752","resolution":{"observed_at":"2026-08-07T11:44:17.989320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.976036Z","title":"Selective listening by syn- chronizing speech with lips,","venue":null,"work_id":"67fb93a6-60ee-4110-b47f-bee69e32193a","year":2022},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.609226Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:4077d5f1b8132060eed476fe17f989752b5f3e7951fe95b93cc3cbaf06a944f3","observation_id":"f0438437-8e1c-409e-98b4-972a0f5f3b27","resolution":{"observed_at":"2026-08-07T11:44:17.979261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.612474Z","title":"Separate anything you describe,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.612474Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:6d65d29ab9c1f3415b8e21e241e6d40af34e9f9cd69be1984479176a3621edf5","observation_id":"5d30796a-9750-4496-8c72-5fdd274688bb","resolution":{"observed_at":"2026-08-07T11:44:17.612474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.962621Z","title":"Target sound extraction with variable cross- modality clues,","venue":null,"work_id":"62434420-882c-4682-96a2-213d6f2d07d2","year":2023},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.615394Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:b832fe6da063a433d5456ecf02679662f443c2016be59c512976ae64048827fb","observation_id":"deeb32eb-e435-4a36-bcd8-02e20723a183","resolution":{"observed_at":"2026-08-07T11:44:17.965765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03710","last_updated":"2025-06-11T01:11:56Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T05:05:38Z","title":"Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience","version":2},"cited_work":{"arxiv_id":"2402.03710","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03710","snapshot_observed_at":"2026-08-07T11:44:17.744501Z","title":"Listen, Chat, and Remix: Text-Guided Soundscape Remixing for Enhanced Auditory Experience","venue":"eess.AS","work_id":"5e5ff88e-20da-43f0-9fae-3f8ad1b07677","year":2024},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.618831Z"},"links":{"cited_paper":"/paper/2402.03710","citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:982b5aea2278ca206f14fe1da4b26f613327b7075f18b367a5ce167c28306851","observation_id":"39d56b24-9396-4cd3-aaeb-30e9fb61eabd","resolution":{"observed_at":"2026-08-07T11:44:17.747923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07284","last_updated":"2024-10-07T06:54:30Z","snapshot_observed_at":"2026-07-06T16:31:03.559653Z","submitted_at":"2023-10-11T08:17:54Z","title":"Typing to Listen at the Cocktail Party: Text-Guided Target Speaker Extraction","version":4},"cited_work":{"arxiv_id":"2310.07284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07284","snapshot_observed_at":"2026-08-07T11:44:17.729363Z","title":"Typing to Listen at the Cocktail Party: Text-Guided Target Speaker Extraction","venue":"eess.AS","work_id":"aa014f19-ef38-4db2-bab2-9791aeb4076d","year":2023},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.623281Z"},"links":{"cited_paper":"/paper/2310.07284","citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:836721e563edd120d56bd03da74b245a52e93930c9608d4c97c8b990cc14f482","observation_id":"86e6b3db-da20-4723-9e83-c02edfd606e3","resolution":{"observed_at":"2026-08-07T11:44:17.734990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.952784Z","title":"Beyond speaker identity: Text guided target speech ex- traction,","venue":null,"work_id":"416a801f-d28f-4e2f-9e0d-9dd40abfd0ac","year":2025},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.627329Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:dec5eee0fe5f215feddcfc8010fe49ad5ab75b39fb9fa19e79636c3c4c021f84","observation_id":"ae5ba8f6-7e8b-43de-b795-21def4d5bc72","resolution":{"observed_at":"2026-08-07T11:44:17.956705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.943836Z","title":"Textrolspeech: A text style control speech cor- pus with codec language text-to-speech models,","venue":null,"work_id":"23e191d9-9d09-4d8b-8d1e-b6d927ae6718","year":2024},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.631051Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:eed57fa8aa09fcf1c7f9fccdef7ab10f18229d108a0405d5dacfa29fd7ba1b31","observation_id":"e9d007e7-2c3f-4fe7-860c-e7707e4b1aba","resolution":{"observed_at":"2026-08-07T11:44:17.946863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.935242Z","title":"Some effects of speaking rate on phonetic percep- tion,","venue":null,"work_id":"c941da77-e8d2-4ace-9128-53929801dba7","year":1981},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.634344Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:5e58ace0757c707024560fe06aecc67b33048fe2a4b75d4db420301a57983aad","observation_id":"12525278-dd3e-4811-bae0-8ac7ca211ee9","resolution":{"observed_at":"2026-08-07T11:44:17.938300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.925844Z","title":"On the just noticeable difference for tempo in speech,","venue":null,"work_id":"3076c1cd-20ba-4723-baf2-8a5853467ef7","year":2007},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.638388Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:6380c8b95cc62c6ca7f36e82775f8b10476fbf526cc5d405597d5a8b5eac1f68","observation_id":"71890180-bd9a-415a-8c15-2a0ed48eb5fa","resolution":{"observed_at":"2026-08-07T11:44:17.929844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.915228Z","title":null,"venue":null,"work_id":"bfbb8b86-3881-4cbb-9e06-4a68bbe42349","year":2012},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.641623Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:e4d7edff188c2cc1decfb9d1f3c84bf6d9723bcf3dbe0efadf7d37544563f283","observation_id":"50a075a5-7495-4abb-b87a-b57fe366234c","resolution":{"observed_at":"2026-08-07T11:44:17.918978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.905677Z","title":"The psychophysics of human sound localization,","venue":null,"work_id":"0c65105e-20df-4d5d-b2c1-ffb750211b9d","year":1997},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.644278Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:cac777d8d45040a1b70be775320277c1a75442afafbfcb8873ac8aa9c1af6929","observation_id":"5f92502c-87b7-44e3-b15d-d0431d678545","resolution":{"observed_at":"2026-08-07T11:44:17.908648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.895933Z","title":"Linville, Vocal Aging","venue":null,"work_id":"dca4d3d5-cc49-4fb5-bc1c-3496dc023a2e","year":2001},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.647723Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:aae6dcb833971bd3227843542e476632688ef867c0fb3d779fd51a26ff1254e1","observation_id":"55163f78-2d57-4b28-be8b-5a369faa9ae0","resolution":{"observed_at":"2026-08-07T11:44:17.899595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.886182Z","title":"Age perceptions and eval- uative reactions toward adult speakers,","venue":null,"work_id":"505ee3e9-fd17-44e3-b73a-a9e790899500","year":1978},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.651335Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:92ee8aa3fcb4d913de3eb227d083d9f11fb8a28d4204e71f13250e035dacf8ca","observation_id":"fc938549-e433-4da5-9a0e-b7f724552a51","resolution":{"observed_at":"2026-08-07T11:44:17.889531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.877351Z","title":"Zwicker and H","venue":null,"work_id":"885d66b2-3681-4d81-8e61-0adc4c9d89ff","year":2013},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.654187Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:8c6874655afd4fb0ee7dfda261d4de6de623e8ad1ff1fddbae350d304ed44b51","observation_id":"cab6f79f-02a8-482c-9eae-01b88de980cf","resolution":{"observed_at":"2026-08-07T11:44:17.880648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.868980Z","title":"Design of speech corpus for mandarin text to speech,","venue":null,"work_id":"7ca4d918-cd2e-4949-91bf-4acee62b3c6b","year":2008},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.657465Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:8a16973444ed528778cec64b9554a6ae3c5efc51471ded729a49eebd8ad9118d","observation_id":"b8698765-2cc0-4fa8-8905-8134fc1bac9f","resolution":{"observed_at":"2026-08-07T11:44:17.872100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.660543Z","title":"Emotional voice con- version: Theory, databases and esd,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.660543Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:b5bc48f82d48cb082abb1a26f94ecf70702170c6d8c34a2abead6d38019c3e38","observation_id":"6efd1c9b-6d58-4c17-9189-c3d602719f41","resolution":{"observed_at":"2026-08-07T11:44:17.660543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.855424Z","title":"Aishell-3: A multi- speaker mandarin tts corpus,","venue":null,"work_id":"7176a2a3-f983-4d10-9310-6cc59c75d5ad","year":2021},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.663986Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:33fbbdadc1d91cc5d51d1da856af6f92e6480d1b9d3209f05418b822399c6cad","observation_id":"773ad523-f82d-4650-aa91-0ac6fa9e3b8c","resolution":{"observed_at":"2026-08-07T11:44:17.858524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.847393Z","title":"Magicdata mandarin chinese read speech corpus,","venue":null,"work_id":"0431b860-4fb9-49ed-b99a-2148c544df21","year":2019},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.666664Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:97902f4f6f5ffdef9c4050a233974d0c7888aa0915898b050323b2fddcb1f216","observation_id":"a91b0749-a0ca-432b-8a8f-77de20952d82","resolution":{"observed_at":"2026-08-07T11:44:17.850398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.838555Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"1c43aaf8-7598-46e8-885b-7767f610282e","year":2015},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.669995Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:1496ddb5f61c79f7337fa683f12f7a5789dea12288b36cdf78b8dd7486a869a4","observation_id":"ac0744b7-f8de-443c-af6d-3d4192fc5327","resolution":{"observed_at":"2026-08-07T11:44:17.841803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.830193Z","title":"French emo- tional speech database - or´eau,","venue":null,"work_id":"b1dfc9e5-4675-41de-aa93-f6f5eee31790","year":2020},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.673127Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:f9812a09428487d5098c72c8add42669e50ec998adde9b7eb6149db52d12ec1f","observation_id":"58e9992e-259e-42cc-ae56-1a4a57695331","resolution":{"observed_at":"2026-08-07T11:44:17.833525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T11:44:17.676650Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.676650Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:1f16db7d34aa2e483d7edfdcd04ee55916611603ba9d8a13ef088068b5c12358","observation_id":"8e080b46-93ad-42d4-936c-7fbec1e5a5ef","resolution":{"observed_at":"2026-08-07T11:44:17.676650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.821973Z","title":"A database of german emotional speech","venue":null,"work_id":"5272d27d-4315-4295-a39a-716787c7949c","year":2005},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.680092Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:8e6cd9b481f8ca7b75ab18b33da882bb11dbd7749e4164d66bb9b396be74a9c2","observation_id":"dd39ea30-5c3b-41d9-9608-c61f831a07be","resolution":{"observed_at":"2026-08-07T11:44:17.825001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.812528Z","title":"Emo- matchspanishdb: study of speech emotion recognition machine learning models in a new spanish elicited database,","venue":null,"work_id":"9be7fbf3-f9a7-467b-9411-375e086c554f","year":2024},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.683353Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:0fbf7e470128a5b6b3953be43118168fc83ee39799708725c47cbdf1b200bd7c","observation_id":"5452ff15-3ac4-458e-8eca-0afa887cabc5","resolution":{"observed_at":"2026-08-07T11:44:17.815847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.803650Z","title":"gpurir: A python library for room impulse response simulation with gpu acceler- ation,","venue":null,"work_id":"e7730e34-15e0-495e-a555-7040bd036f2d","year":2021},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.686580Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:d946cc559a36971dca406f6dc300fff01dbc30a5ce7ea2ed68e0058628f38d46","observation_id":"a6a83da5-bd20-4ffa-b1b4-51913d002d05","resolution":{"observed_at":"2026-08-07T11:44:17.807109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.794518Z","title":"Target speech extraction with pre-trained self- supervised learning models,","venue":null,"work_id":"620fb8f8-c265-4b36-8397-74727fb47f86","year":2024},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.689907Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:31738cd74e78523c9a03e198d020699d8ecaed83910cefee3cabb7a9e8e57917","observation_id":"9fc6c369-e307-4c10-b138-92e28866e4c9","resolution":{"observed_at":"2026-08-07T11:44:17.798150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.785251Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":"3219bdbd-1df6-48ad-8f59-0c5921010fda","year":2021},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.693299Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:d2fcfa4752d31381f305639631a2c738a449f7c55d71b1000d76c0797d6c79ac","observation_id":"710e4f4b-5441-4b55-99ea-7b718e022b87","resolution":{"observed_at":"2026-08-07T11:44:17.789021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.776798Z","title":"Sdr–half- baked or well done?","venue":null,"work_id":"7848077d-7877-4956-9f5c-aa14261e540f","year":2019},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.696439Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:a7a68ebd81b341d5a2303781f1286d829bc3e25808c3e7e6f2a39e70118a3ed4","observation_id":"c9a2bb93-d6c8-436b-a97e-19af89009dec","resolution":{"observed_at":"2026-08-07T11:44:17.779656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.766846Z","title":"Perceptual eval- uation of speech quality (PESQ)-a new method for speech qual- ity assessment of telephone networks and codecs,","venue":null,"work_id":"2b3380b3-7900-4dd9-83c1-8f3ba608340f","year":2001},"citing_paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.699820Z"},"links":{"citing_paper":"/paper/2506.01483"},"observation_digest":"sha256:dfbe636bf435468d1a9bf76a4e291040cc15eb0132c170307126b64abfdee62c","observation_id":"e2f34c45-63d8-4f7b-918c-2caf1bcf5750","resolution":{"observed_at":"2026-08-07T11:44:17.770407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01483","last_updated":"2025-06-08T14:19:33Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T11:37:52.289248Z","submitted_at":"2025-06-02T09:43:43Z","title":"Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2506.01483."}