{"as_of":"2026-08-11T14:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3ddd89d1182df1e9d54bb7eaa7c1eacafde1fdf8902a35f49b6dd4e4d4b613f","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:18:15.195399Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.05332/citation-record","integrity":"/paper/2501.05332/integrity","json":"/paper/2501.05332/citation-record.json","paper":"/paper/2501.05332"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:16.050188Z","title":null,"venue":null,"work_id":"36ce39d9-a964-4d0c-8e73-d2f802e5a752","year":1976},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.921168Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:c2fc176c0250be7d698765435e2cd6e6a981b17b1f4227bd2cb168f1ac405bdd","observation_id":"78316f17-55a2-4429-872a-b6473ab948d5","resolution":{"observed_at":"2026-08-10T21:18:16.056272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:16.034334Z","title":"Speech analysis/synthesis based on a sinusoidal representation,","venue":null,"work_id":"cad04f1d-bc59-40f3-82e0-4aee4d362237","year":1986},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.927861Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:1fa9a46b211fcd2546ce0d29bf8bb85e4b65f7012490454899fde5a24e13ec42","observation_id":"cf939511-44de-4644-af16-085bce42c0ac","resolution":{"observed_at":"2026-08-10T21:18:16.039414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:16.014998Z","title":"Speech analysis/synthesis and modifica- tion using an analysis-by-synthesis/overlap-add sinusoidal model,","venue":null,"work_id":"90dc5332-c17d-44ba-847c-1465dbff4033","year":1997},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.933873Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:61dc75743d0357ce7f200d73576cf788d2c93bbaf77504ef307bf2dc0d71742d","observation_id":"c97c97b4-7d2d-4cca-8193-6c69c27c2290","resolution":{"observed_at":"2026-08-10T21:18:16.021198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.991041Z","title":"Spectral modeling synthesis: A sound analy- sis/synthesis system based on a deterministic plus stochastic decomposi- tion,","venue":null,"work_id":"29278d71-245d-46a3-bf97-e39a8d7144cc","year":1990},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.939389Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:de9cbfa7bc4ca1d3ef68c14464da0ee4b078530426e6864395aa3a5ca5762fb5","observation_id":"8a77f054-5119-4a95-a723-b81134781679","resolution":{"observed_at":"2026-08-10T21:18:16.001357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.971497Z","title":"HNS: Speech modification based on a harmonic + noise model,","venue":null,"work_id":"096b47c3-a5b7-4e39-bcaa-7a24234c8dd5","year":1993},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.945301Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:493ff5db6d2a64d3b94f83285bad6320f2da99b1b8112e4821785119bb3b3283","observation_id":"ab84d7e6-ad06-4345-87f5-2bb589433605","resolution":{"observed_at":"2026-08-10T21:18:15.977931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.950841Z","title":"Analysis/synthesis and modification of the speech aperiodic component,","venue":null,"work_id":"aced3320-d4ec-41c0-a950-c5ff03c46c64","year":1996},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.950661Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:b4f058c6999385a058dbfe0f611b99966fb6b0f7d26c21bff1c6ae14b1146110","observation_id":"188a3b83-9118-433d-a814-fc430dc3649b","resolution":{"observed_at":"2026-08-10T21:18:15.957651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.924401Z","title":"Pitch-synchronous waveform processing techniques for text-to-speech synthesis using diphones,","venue":null,"work_id":"da4a2d3f-4ed2-4f7a-adc2-49bfb9538fb0","year":1990},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.956552Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:a74483c31a2aa0395f226b77b8c9cdde56f98129f9246d1029732bd2d2ab270c","observation_id":"9455ab30-511c-45e4-9d69-20246d1ccfd7","resolution":{"observed_at":"2026-08-10T21:18:15.937209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.905552Z","title":"Improved phase vocoder time-scale modi- fication of audio,","venue":null,"work_id":"257fdb7f-453d-41b0-ac18-702b2b386fa6","year":1999},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.961508Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:f5b8817129986ad5a62fed346fc3c046bc7f93d761ab5a80d9e3febdc88a8072","observation_id":"e7f06493-4983-4df9-bd53-89ec86b944a3","resolution":{"observed_at":"2026-08-10T21:18:15.911352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.887956Z","title":"STRAIGHT, exploitation of the other aspect of VOCODER: Perceptually isomorphic decomposition of speech sounds,","venue":null,"work_id":"13cba154-98c4-4180-bb1e-a63a95cbfcc8","year":2006},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.966599Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:016ca4ce2767cb9901a5cb33d157cfd0767f149ac7cfb921ecaaf9e58155e8d9","observation_id":"e74256c8-99bb-49da-89e2-0240c9d9bdda","resolution":{"observed_at":"2026-08-10T21:18:15.893689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.867868Z","title":"World: a vocoder-based high- quality speech synthesis system for real-time applications,","venue":null,"work_id":"c8cf566d-7bf7-4d03-a1d9-0855e467436e","year":2016},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.971913Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:020519f252bb237b878467959ce7f18912cde6f7e938f4669d18c4bddcfe29a9","observation_id":"09759bbd-2886-4718-be68-de420a8b5dc9","resolution":{"observed_at":"2026-08-10T21:18:15.874649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.847743Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"ce139b5a-0b93-4c71-a8af-143cd28842c4","year":2021},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.976248Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:4c8c9e71dbe3da401b394edb727f9b832ad49d829d59fc2748f3b422ecbcfb0d","observation_id":"ef9f6a6b-fccc-4a3c-a941-b8d69dc941d3","resolution":{"observed_at":"2026-08-10T21:18:15.854015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:14.980882Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.980882Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:0a671c06a43adba61d43237af3491ebe7b584af2476e6ab89124c27defa1c7d4","observation_id":"cbeca490-e130-432e-89c3-f35dc3aa61a0","resolution":{"observed_at":"2026-08-10T21:18:14.980882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.815771Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"2fa7f608-2a88-439c-ad7e-7fdb21a19ad6","year":2021},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.985768Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:99c1c7e01563aab7689548db8d40b20d5358bf5cafee8c1687f018f7fd8c2b06","observation_id":"caa1de04-6e11-47e2-a2ca-af8b7e9b465e","resolution":{"observed_at":"2026-08-10T21:18:15.822520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00355","last_updated":"2021-07-27T14:27:27Z","snapshot_observed_at":"2026-08-09T13:24:51.366298Z","submitted_at":"2021-04-01T09:20:33Z","title":"Speech Resynthesis from Discrete Disentangled Self-Supervised Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00355","snapshot_observed_at":"2026-08-10T21:18:14.990854Z","title":"Speech resynthesis from discrete disentangled self-supervised representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.990854Z"},"links":{"cited_paper":"/paper/2104.00355","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:5fba0c4f1552d0ef5b90917f2dd6626928e0faf1dc464c468dbd36546991ea43","observation_id":"c9521e5c-be4e-42b5-b8a2-e72bb11f31ff","resolution":{"observed_at":"2026-08-10T21:18:14.990854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.798064Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":"8b816fc1-b7d6-49ec-bf78-f8c5e8d0684f","year":2022},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:14.997002Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:83cd9e4573b48d60a785aa94bf278eb423bb8227009bfae3c85422cf113559c7","observation_id":"87ea4ccf-987b-4777-9fd3-b96796e9e6a6","resolution":{"observed_at":"2026-08-10T21:18:15.803457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.780728Z","title":"Hifi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"df6686cf-91ce-47bf-b0c2-c89d98ea68df","year":2020},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.011918Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:78c9ce58c8161fc25454bacabe1f42183d7c9d0a0c6f5e9e3817f251fda677b6","observation_id":"cfa6c315-f0c5-4f3c-ad6b-037b4117194d","resolution":{"observed_at":"2026-08-10T21:18:15.786693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.757937Z","title":"CREPE: A convolutional representation for pitch estimation,","venue":null,"work_id":"7f22a4f2-49e3-471f-aeea-84107d63589c","year":2018},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.020133Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:eb0c6fbd4038fa76e32bf67aedbc0bbb2d21b6820135f6ae397b6defc1a18e83","observation_id":"764b5b8e-019d-448b-b4a8-547843a84ddd","resolution":{"observed_at":"2026-08-10T21:18:15.763028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-10T21:18:15.025829Z","title":"Ecapa-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.025829Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:1f23c298ac1b28a51cf9a633078060491c1df9f8e9b87ea203dd792f2bf5ff37","observation_id":"f2252bfe-383e-4dcd-8ce8-a514fd94867f","resolution":{"observed_at":"2026-08-10T21:18:15.025829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.742281Z","title":"Brouhaha: Multi- task training for voice activity detection, speech-to-noise ratio, and c50 room acoustics estimation,","venue":null,"work_id":"4cc8945f-31e3-4d93-ab7e-71103e6d719f","year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.032234Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:8462047199c1648e9994a2f307228514609ea7b9b69401b642815cc76b5d9ab7","observation_id":"be57210f-98ea-44cc-8da8-2b47308fb7bc","resolution":{"observed_at":"2026-08-10T21:18:15.747351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.726359Z","title":"Neural discrete representation learning,","venue":null,"work_id":"b6d57eb2-3cdd-412d-955a-47476525e5c0","year":2017},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.039976Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:588c8304307da6644764ac2e60bba2644cbfaceb922b0c569baba789681e35dc","observation_id":"cd3d3ccd-d69f-42f2-86e1-a075dd9b3454","resolution":{"observed_at":"2026-08-10T21:18:15.731382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03568","last_updated":"2025-05-09T08:19:45Z","snapshot_observed_at":"2026-07-06T15:23:49.202914Z","submitted_at":"2023-05-05T14:19:46Z","title":"A vector quantized masked autoencoder for audiovisual speech emotion recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03568","snapshot_observed_at":"2026-08-10T21:18:15.048903Z","title":"A vector quantized masked autoencoder for audiovisual speech emotion recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.048903Z"},"links":{"cited_paper":"/paper/2305.03568","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:79e3610a3caa002509bcaddfcf832f5630edb641f659415bdc583fb4f4c6013d","observation_id":"0131dad0-d0cc-41a3-9ce5-e2bf3e9f6390","resolution":{"observed_at":"2026-08-10T21:18:15.048903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.709265Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"4613e77e-11e6-4572-8c16-702adb854ab2","year":2022},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.055931Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:bc8f09196d0be2d8c43e1a8878ff3c3f02a5234a8e6b81359038ed62c432737f","observation_id":"5b12b587-a5e6-4c31-a7e9-00eead8f41b0","resolution":{"observed_at":"2026-08-10T21:18:15.715030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.692173Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"3851a5e3-fdcb-4550-a255-60ce3ef5f27a","year":2020},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.061930Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:aa18b14cbd83d00785b4788fa2e9807ad015a4cfcd757aa18d68287d98315053","observation_id":"9c9d8261-2a90-4ef7-9df1-48e127b2fe7b","resolution":{"observed_at":"2026-08-10T21:18:15.697722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.677087Z","title":"Attention is all you need,","venue":null,"work_id":"6b24ad26-d816-48d7-8eaf-7c37a5e10a4b","year":2017},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.069225Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:5474e141d7f85680a959e29d39ce4495b1c090539077306a8bfa967c2bad2f85","observation_id":"3c0d0dc3-acb0-4387-a660-9bafcd021556","resolution":{"observed_at":"2026-08-10T21:18:15.682108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.00264","last_updated":"2020-09-23T03:16:28Z","snapshot_observed_at":"2026-08-09T03:24:29.943798Z","submitted_at":"2020-08-01T13:42:29Z","title":"DCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.00264","snapshot_observed_at":"2026-08-10T21:18:15.078041Z","title":"DCCRN: Deep complex convolution recurrent network for phase-aware speech enhancement,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.078041Z"},"links":{"cited_paper":"/paper/2008.00264","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:6e910cbd8033271dfac202110e1865279011b3dd27918275539b6ee85fdadad4","observation_id":"ead23dc7-9872-488e-bf7f-f032c23489c4","resolution":{"observed_at":"2026-08-10T21:18:15.078041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.661015Z","title":"Phase- aware speech enhancement with deep complex U-net,","venue":null,"work_id":"d01fe1f7-8e7a-4d65-af78-b5941fb77719","year":2018},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.084578Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:29a3504d641dc386fd72c0d412db046ceb6daf3c4ad645f4965a148ea6ace0da","observation_id":"512054d5-6ed5-4586-83dc-012f29817b1a","resolution":{"observed_at":"2026-08-10T21:18:15.666451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.13975","last_updated":"2020-08-14T10:52:10Z","snapshot_observed_at":"2026-08-11T12:55:43.645990Z","submitted_at":"2020-07-28T03:51:28Z","title":"Dual-Path Transformer Network: Direct Context-Aware Modeling for End-to-End Monaural Speech Separation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.13975","snapshot_observed_at":"2026-08-10T21:18:15.089856Z","title":"Dual-path transformer network: Direct context-aware modeling for end-to-end monaural speech separation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.089856Z"},"links":{"cited_paper":"/paper/2007.13975","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:a352cb903ec996545ed049fbe74d913ab9cc19b486a6b2127225616b052b2602","observation_id":"0de9e15e-57ae-4738-aec3-aba81e331c3c","resolution":{"observed_at":"2026-08-10T21:18:15.089856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.643372Z","title":"Conv-tasnet: Surpassing ideal time–frequency magnitude masking for speech separation,","venue":null,"work_id":"f7deb4ae-d0ae-4904-a740-06d564e5baf8","year":2019},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.095540Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:81f245299d30ffdb7814f3a3ab66e9923de1782b056592145e956f7cd78cfa4e","observation_id":"c94154bf-a919-4a22-848b-827755ed68b3","resolution":{"observed_at":"2026-08-10T21:18:15.649768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.626620Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"9947d80f-53c8-4325-889d-dbb7cb96babf","year":2015},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.101155Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:b41ce8e45c05bc099620bde175b25b279bb8deb46f9424b7a6adc29fa52fde72","observation_id":"a1c9c67c-0775-47b4-b998-8cc8c4419e08","resolution":{"observed_at":"2026-08-10T21:18:15.632143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.610954Z","title":"DEMAND: a collection of multi- channel recordings of acoustic noise in diverse environments,","venue":null,"work_id":"d1e18c34-7a2b-4677-b823-b3299ff95406","year":2013},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.106247Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:610beacaef6fe90fa5872f6ee3efe6da510d2b5e3ad7661e0a00d12796ae8cfd","observation_id":"1b54d229-4a4f-46f9-8fd5-7a8766f7cacc","resolution":{"observed_at":"2026-08-10T21:18:15.616365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.110816Z","title":"Pedalboard,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.110816Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:c675c1a471c9160146eaa6aa5c26ff40cfa24e6867304f39478dd822fd2443be","observation_id":"fecfb541-5dc9-4496-b178-08330e6a079a","resolution":{"observed_at":"2026-08-10T21:18:15.110816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-10T10:54:26.224254Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-10T21:18:15.115417Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.115417Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:3b94e6f72fb9e6c1a60b824584bbac00398d63659e27448301bac7ee5aa48ff5","observation_id":"2f270ae9-7702-4761-bae5-017a66649232","resolution":{"observed_at":"2026-08-10T21:18:15.115417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.592924Z","title":"Wham!: Extending speech separation to noisy environments,","venue":null,"work_id":"7495c2df-8459-4144-85df-ea1d60d657b1","year":2019},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.120486Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:1232e92355f64a73f40718f3f87537b77468cf580e8dd62f699466a142f1ade5","observation_id":"a8e88527-72e1-4c09-890a-5cc3a0765c84","resolution":{"observed_at":"2026-08-10T21:18:15.599067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T21:18:15.129971Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.129971Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:93e1b118b5eb2268ae602a1629b23df00bdaf27f21d49e93a5618a26b85632fa","observation_id":"d47231e4-35b9-4781-a762-26a42955d8a6","resolution":{"observed_at":"2026-08-10T21:18:15.129971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.576910Z","title":"SDR–half-baked or well done?","venue":null,"work_id":"977ef93a-3979-4173-88ea-73644e1c9281","year":2019},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.136261Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:4834da876b790b4cc0a69e887b53cc9cf23b57201008f22ed52c63ee617636b3","observation_id":"2f8f3491-dbb2-4707-a545-67bf629a53cd","resolution":{"observed_at":"2026-08-10T21:18:15.581834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.561098Z","title":"Perceptual evaluation of speech quality (PESQ) – a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"318b9b26-af3a-4c33-9051-c7790bad4ff7","year":2001},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.142181Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:d53789af07c8044c0598fe95641721360a0c34b90115e29114d4e2157ba0c42e","observation_id":"3b48262a-ffeb-4c02-bfa6-c10ab9d26b63","resolution":{"observed_at":"2026-08-10T21:18:15.566373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.545789Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"da227df8-df5d-40b5-83a1-c876b29bd532","year":2011},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.147179Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:3d193cad50addd42f0a1530dcec287d52a7510e2769faa093ee054e2bab387d5","observation_id":"8b20d736-d8d6-40eb-b500-868462a92682","resolution":{"observed_at":"2026-08-10T21:18:15.550740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.529051Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":"ab37f24b-2eb8-42d0-a6a2-aa883061a7ea","year":2018},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.152200Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:b75e440d903ec51e91ca2bb67ec14e72f8508042e94a2b38f6ce18f101e1595f","observation_id":"d7e7dd40-04d7-4d69-a8f0-bca3b4530130","resolution":{"observed_at":"2026-08-10T21:18:15.534553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.511714Z","title":"Speech quality assessment through MOS using non-matching references,","venue":null,"work_id":"9cf705f1-0b2a-4925-950c-067074e28f80","year":2022},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.157220Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:7845471d1c3acca4d0c508986ae88587ed23bf8c73c0a082137f15d4145e8d6c","observation_id":"45192b41-6934-44e2-8e63-2e92347c00bb","resolution":{"observed_at":"2026-08-10T21:18:15.517122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.495024Z","title":"Torchaudio-Squim: Reference-less speech quality and intelligibility measures in Torchaudio,","venue":null,"work_id":"2db47fab-991d-4429-aa1b-d40e4092118a","year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.162432Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:6ca6621fe3b016500861dd5a09d8393b813bb4de98b2612c4ef1c0dd06bc45b9","observation_id":"1f76d720-2f26-40d7-9d5d-f9e853a80288","resolution":{"observed_at":"2026-08-10T21:18:15.500396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.477237Z","title":"DNSMOS P.835: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"4082f7f7-1b00-4573-8f5e-f8c48c312311","year":2022},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.167258Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:583484e15af47d27a203f677496e03444802088264d1c909cd871d267a3b2269","observation_id":"ce955239-e364-4fda-991a-f0bf358e0c7a","resolution":{"observed_at":"2026-08-10T21:18:15.482873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.459074Z","title":"A pitch tracking corpus with evaluation on multipitch tracking scenario,","venue":null,"work_id":"1e268549-6024-4880-8678-f5443d182f0b","year":2011},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.172809Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:769fedf833854c41f09f7fecc59b86711f9434f9b206eef5f6a114c805594f2e","observation_id":"7ed81e39-7248-4c77-a725-851eead3c682","resolution":{"observed_at":"2026-08-10T21:18:15.465591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.440022Z","title":"pYIN: A fundamental frequency estimator using probabilistic threshold distributions,","venue":null,"work_id":"4c88a0a4-698a-4a8b-a679-eacc7b119eb7","year":2014},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.178371Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:0439fdf8a00976d427c2db46e7b2c8a0f130701d33515efa8bd70e3b16760427","observation_id":"5b793503-8cbb-4b0c-8407-9945181c9317","resolution":{"observed_at":"2026-08-10T21:18:15.445626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.184183Z","title":"A sawtooth waveform inspired pitch estimator for speech and music,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.184183Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:7e4e4f2eceff1ca01577884e35f04aeff7abd1bd30d4efb6e77ae95b9d8ff923","observation_id":"e31f8484-8a53-46c8-b473-90725fca49ec","resolution":{"observed_at":"2026-08-10T21:18:15.184183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.407059Z","title":"Revise: Self- supervised speech resynthesis with visual input for universal and generalized speech regeneration,","venue":null,"work_id":"ab577697-06d8-4a0b-8b5a-a1d85254bb30","year":2023},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.190587Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:7c1a60f0e067f3f212b732412ee3136a57f75690d949d720ea2dad96b3a8066d","observation_id":"3016e0d9-78bb-43c2-b5bf-7450912cd148","resolution":{"observed_at":"2026-08-10T21:18:15.412512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:18:15.388357Z","title":"Generating diverse high- fidelity images with VQ-V AE-2,","venue":null,"work_id":"7ca6e88f-dfc3-4a96-878a-336b75c75343","year":2019},"citing_paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:15.195399Z"},"links":{"citing_paper":"/paper/2501.05332"},"observation_digest":"sha256:bedb12ef831b1117523e244e2cc58d4b4372661465cf16b4fbe20c3dbf147ed5","observation_id":"6cda7d60-be83-49b5-84b9-70df58dceec9","resolution":{"observed_at":"2026-08-10T21:18:15.395111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.05332","last_updated":"2025-01-09T15:58:37Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T21:11:57.531282Z","submitted_at":"2025-01-09T15:58:37Z","title":"AnCoGen: Analysis, Control and Generation of Speech with a Masked Autoencoder"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2501.05332."}