{"as_of":"2026-08-16T03:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cafa99817e45b224a28784931ad9287b3a070c8d9fbdf602a791b7ffc49b65a3","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:01:29.676332Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.18919/citation-record","integrity":"/paper/2501.18919/integrity","json":"/paper/2501.18919/citation-record.json","paper":"/paper/2501.18919"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.08739","last_updated":"2024-08-16T13:37:20Z","snapshot_observed_at":"2026-08-13T19:18:40.221773Z","submitted_at":"2024-08-16T13:37:20Z","title":"ASVspoof 5: Crowdsourced Speech Data, Deepfakes, and Adversarial Attacks at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08739","snapshot_observed_at":"2026-08-09T22:01:29.624531Z","title":"Asvspoof 5: Crowdsourced speech data, deepfakes, and adversarial attacks at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.624531Z"},"links":{"cited_paper":"/paper/2408.08739","citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:98b7dd0c4accadcaf3711fc436fb735cda22878886f4da4c2ecf6e1f28fe89f7","observation_id":"e7884cc9-152b-401b-85ea-c26c7b257bf8","resolution":{"observed_at":"2026-08-09T22:01:29.624531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.994288Z","title":"Vulnerability issues in automatic speaker verification (ASV) systems,","venue":null,"work_id":"0a24703d-f1a1-4473-be29-c36f5e04d31b","year":2024},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.628731Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:e01ec1481c7af13f48260a08390883fe4f441e0433c6e95193422b2fc88b0f40","observation_id":"17e5790d-b201-40ae-aa4b-df60e846e6de","resolution":{"observed_at":"2026-08-09T22:01:29.997777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.984185Z","title":"Visinger: Variational inference with adversarial learning for end-to-end singing voice synthesis,","venue":null,"work_id":"4d4d22a2-a629-47ec-b76d-1b707661fc4f","year":2022},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.632041Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:46d4eeda2d07646e706ba282170595466719e898306074a4a1a09e03a511bba1","observation_id":"6f0203a1-c935-4c7e-8830-3f8b620a150a","resolution":{"observed_at":"2026-08-09T22:01:29.987883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.974208Z","title":"Diffsinger: Singing voice synthesis via shallow diffusion mechanism,","venue":null,"work_id":"6a846f97-911c-494a-a6c2-e407d6b44472","year":2022},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.635653Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:980238f63dc8978a715661cdc715f1c5f0ba6a80a61bd369de4209b887961181","observation_id":"0894bf25-0541-4c78-890f-6c3a5e419a5d","resolution":{"observed_at":"2026-08-09T22:01:29.977291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.965235Z","title":"Midi-voice: Expressive zero-shot singing voice synthesis via midi-driven priors,","venue":null,"work_id":"e5373ea7-4aa6-4a14-906e-7d01938b5c6b","year":2024},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.639190Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:701907354800f469da5c1f98a8f7bfc6187c562b099ebe6f1e0186f896878c13","observation_id":"cc59e713-0837-4127-887d-d165d73241cc","resolution":{"observed_at":"2026-08-09T22:01:29.968300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.956018Z","title":"Sintechsvs: A singing technique controllable singing voice synthesis system,","venue":null,"work_id":"8e620bfd-ecff-4beb-abd1-36709b53940f","year":2024},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.642435Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:03480fd2302e11d24aa03dbd72c7ad6f4715590aff7d5c107c09e47ff414189c","observation_id":"3e5aa955-04b0-4e02-8120-77dbf1698e28","resolution":{"observed_at":"2026-08-09T22:01:29.959180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2309.07525","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.851092Z","title":"Singfake: Singing voice deepfake detection,","venue":null,"work_id":"de7e2678-18a0-4ca8-be06-6b63b217ba9d","year":2024},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.645756Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:7aed963ec0d1a3433375c8408c55e67392071c523ae4638914cfe415a9f9c3a2","observation_id":"bfad7d8b-22f3-4776-87d5-c8bd9e6fd41f","resolution":{"observed_at":"2026-08-09T22:01:29.859370Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.648510Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.648510Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:6753d5577c8eaba65425d929fc3046c8fa6c78c33252d603d9488987c2e006a5","observation_id":"13a450de-71bd-4c75-8848-df4c53b6df59","resolution":{"observed_at":"2026-08-09T22:01:29.648510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.939963Z","title":"Whisper-AT: Noise- robust automatic speech recognizers are also strong general audio event taggers,","venue":null,"work_id":"baa3fe71-d67f-49b2-930d-50731f00bf75","year":2023},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.651539Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:e4a538fcef8e35ef763ad0a2f4213008e09d51dfac5e1cf4c008b1370d554de4","observation_id":"eaa66595-6426-46d5-b8db-de5e8d06bdc5","resolution":{"observed_at":"2026-08-09T22:01:29.943528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-15T23:59:39.932635Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-09T22:01:29.654338Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.654338Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:ddd55b983df32cc9a3c5ff33be823fa85ae95d60363f457a61ba3f75ab240a49","observation_id":"2627ff73-870c-4990-97fb-dfb158136340","resolution":{"observed_at":"2026-08-09T22:01:29.654338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.929313Z","title":"Invariant representations for noisy speech recognition,","venue":null,"work_id":"98bc74b3-8b98-45eb-a447-e651200b4b63","year":2016},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.657540Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:8a31bb28b9267823f0b0b647504ed033b90878a788512dfb725f19dbc7efc744","observation_id":"1ba5303e-4e87-4166-beb2-8fc9a90a7da8","resolution":{"observed_at":"2026-08-09T22:01:29.933211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.918498Z","title":"Learning noise-invariant representations for robust speech recognition,","venue":null,"work_id":"58e15b6c-22f3-46f3-8741-bb9ee9e8a209","year":2018},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.660236Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:712ab4f2975512472e058f8f1de58ffb7975accd8b39882a290735e27658c7a7","observation_id":"46a6252e-bcc1-4b11-8e32-979ce0d63482","resolution":{"observed_at":"2026-08-09T22:01:29.922339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.907448Z","title":"A noise-robust self-supervised pre-training model based speech representation learning for automatic speech recognition,","venue":null,"work_id":"e0469e85-1ebc-434b-8bb2-8180d24eec15","year":2022},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.663171Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:4919f4a5ec38ce861c821a5962cb34cc0495700ccc73a5f4593a41227ca87d30","observation_id":"d0e43df8-43b4-4eeb-abcf-53661500b285","resolution":{"observed_at":"2026-08-09T22:01:29.911605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.896528Z","title":"Unsupervised learning of time–frequency patches as a noise-robust representation of speech,","venue":null,"work_id":"e476660a-de85-4728-bc58-d169c3b59711","year":2009},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.666193Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:b276b5718d675081635ad9a3bb6908dbd83a163d4ec6a9aecae8c10180d095a1","observation_id":"6d92f38f-6561-4450-9781-ea6bb4005d2e","resolution":{"observed_at":"2026-08-09T22:01:29.900155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01174","last_updated":"2019-09-03T13:41:56Z","snapshot_observed_at":"2026-08-15T22:53:28.311152Z","submitted_at":"2019-09-03T13:41:56Z","title":"Demucs: Deep Extractor for Music Sources with extra unlabeled data remixed","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01174","snapshot_observed_at":"2026-08-09T22:01:29.669479Z","title":"Demucs: Deep extractor for music sources with extra unlabeled data remixed,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.669479Z"},"links":{"cited_paper":"/paper/1909.01174","citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:0252c9912c70160c082364f158edbd129bf2717b8d4311699946bcce6ff5e3e7","observation_id":"c629cc56-827a-4de2-b089-638f5822f1a2","resolution":{"observed_at":"2026-08-09T22:01:29.669479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.886509Z","title":"Computationally-efficient voice activity detection based on deep neural networks,","venue":null,"work_id":"0aadb193-9157-4d8b-9eff-ba17b64ac88d","year":2021},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.673284Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:4a4cdce9da12be758576fc4e44d56ebb53e132d855857a5b2a0f13d2923ac1ce","observation_id":"e410df5b-a605-4a62-8673-6709c5502b9a","resolution":{"observed_at":"2026-08-09T22:01:29.890043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:01:29.876193Z","title":"Pyannote. audio: neu- ral building blocks for speaker diarization,","venue":null,"work_id":"e268e85d-39e6-49cc-be69-7df1d1a58e59","year":2020},"citing_paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T22:01:29.676332Z"},"links":{"citing_paper":"/paper/2501.18919"},"observation_digest":"sha256:57032a3c8afb958b564cd278693171a51276c20d743831a42ade9e6891cabbb9","observation_id":"d9913635-5c40-472f-98cf-451174f351c7","resolution":{"observed_at":"2026-08-09T22:01:29.880003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.18919","last_updated":"2025-01-31T06:43:50Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T02:08:54.640547Z","submitted_at":"2025-01-31T06:43:50Z","title":"Deepfake Detection of Singing Voices With Whisper Encodings"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2501.18919."}