{"as_of":"2026-08-12T13:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94261b47b364c0f38f19f04dec144b361cbf0efe5ae538110e7d1e00e2e49aa8","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:30:11.003867Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.04425/citation-record","integrity":"/paper/2412.04425/integrity","json":"/paper/2412.04425/citation-record.json","paper":"/paper/2412.04425"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-11T21:30:10.858559Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.858559Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:a5d519614712f852107bca918cbb5d12a25a4c7a1f4bf426a96171bea763a102","observation_id":"191a3cb1-5bee-4543-8734-9b1cd2e734ff","resolution":{"observed_at":"2026-08-11T21:30:10.858559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.543875Z","title":"Neil Houlsby, Andrei Giurgiu, Stanislaw Jastrzebski, Bruna Morrone, Quentin De Laroussilhe, Andrea Gesmundo, Mona Attariyan, and Sylvain Gelly","venue":null,"work_id":"bac727c1-3237-4c02-966e-05c7f59d55b8","year":1939},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.886416Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:6d928337d932b4628d62088e635f741e25e1f4b912a5f5b57a3fa7eb1fb06fdc","observation_id":"e29ef60a-4c47-4038-bc5c-f921c24d4f35","resolution":{"observed_at":"2026-08-11T21:30:11.551075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T21:30:10.892731Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.892731Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:be6a86123747cbdd834d62814e7cff5c409a19beb39a7af8937543cbdd811e42","observation_id":"59674a73-704d-4d62-9bcb-fb42240fd388","resolution":{"observed_at":"2026-08-11T21:30:10.892731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05858","last_updated":"2019-09-20T20:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-11T17:57:18Z","title":"CTRL: A Conditional Transformer Language Model for Controllable Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05858","snapshot_observed_at":"2026-08-11T21:30:10.899498Z","title":"Ctrl: A conditional transformer language model for controllable generation","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.899498Z"},"links":{"cited_paper":"/paper/1909.05858","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:c754e271517ee8699ecdc7d405945a7b736d2ac85e0ca36e70536da06ce9ce2c","observation_id":"37bf7a0a-85f1-4d61-8507-079cee339aa9","resolution":{"observed_at":"2026-08-11T21:30:10.899498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.522485Z","title":"A study on data augmentation of reverberant speech for robust speech recognition","venue":null,"work_id":"f5c78679-0e12-4999-8a02-7f5df295f918","year":2017},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.907151Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:0c1250246a1b3cca939ae7c447ff0723f16aca3ac3ad700d4cb32c58121b7b79","observation_id":"eec5deaa-1c0f-4fc9-8393-d231cf4da5fa","resolution":{"observed_at":"2026-08-11T21:30:11.529143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-08T04:51:01.052037Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-11T21:30:10.922581Z","title":"V oxceleb: a large-scale speaker identifica- tion dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.922581Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:d7045dabb9d8050a58ebca40d7d6381c6417d79b0aa0211ed18365a39e62ffc2","observation_id":"6e7b5ffb-29d9-4f1e-bc4a-668de645c949","resolution":{"observed_at":"2026-08-11T21:30:10.922581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10615","last_updated":"2025-02-24T18:06:55Z","snapshot_observed_at":"2026-08-04T15:29:25.040229Z","submitted_at":"2023-05-18T00:01:27Z","title":"ML-SUPERB: Multilingual Speech Universal PERformance Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10615","snapshot_observed_at":"2026-08-11T21:30:10.947236Z","title":"Ml-superb: Multilingual speech universal performance benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.947236Z"},"links":{"cited_paper":"/paper/2305.10615","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:cac4e478ef19a301e3bafa8ced01818779a01290d4d75c5f86b7033da92393ef","observation_id":"8976bf4a-5cc0-44ad-ba51-f47f190fc29d","resolution":{"observed_at":"2026-08-11T21:30:10.947236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05409","last_updated":"2022-04-11T20:59:51Z","snapshot_observed_at":"2026-08-05T15:56:25.463538Z","submitted_at":"2022-04-11T20:59:51Z","title":"Unified Speech-Text Pre-training for Speech Translation and Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05409","snapshot_observed_at":"2026-08-11T21:30:10.964761Z","title":"Unified speech-text pre-training for speech translation and recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.964761Z"},"links":{"cited_paper":"/paper/2204.05409","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:1a168b690e6c9ee89c605d8e88df5a4ec81e3c953f518c4a235a66b2f8942c80","observation_id":"8d438f6b-c4e6-47f8-9af7-8a1956bb0ec1","resolution":{"observed_at":"2026-08-11T21:30:10.964761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/odyssey.2022-30","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.044938Z","title":"URL https://www.isca-speech","venue":null,"work_id":"3481c729-c64e-43db-b8fc-ce662b1df575","year":2022},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.972131Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:ed9a83d3a042b47b2c60a8566337c8936b949ce8542009ac79095d0d1c7d904e","observation_id":"f1a1ade0-c8b1-4b62-9572-4b7b917635ae","resolution":{"observed_at":"2026-08-11T21:30:11.052239Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-09T19:09:23.880235Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-11T21:30:10.982319Z","title":"Changhan Wang, Morgane Riviere, Ann Lee, Anne Wu, Chaitanya Talnikar, Daniel Haziza, Mary Williamson, Juan Pino, and Emmanuel Dupoux","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.982319Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:d55d485f38fb0d344b7cbfe7780e57a863ff0b38fef7a7cae7307a0e71d71b58","observation_id":"3d464ebc-e6c3-4f03-9102-50a4f111c769","resolution":{"observed_at":"2026-08-11T21:30:10.982319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00015","last_updated":"2018-03-30T18:09:39Z","snapshot_observed_at":"2026-08-10T10:28:25.759884Z","submitted_at":"2018-03-30T18:09:39Z","title":"ESPnet: End-to-End Speech Processing Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.00015","snapshot_observed_at":"2026-08-11T21:30:10.988307Z","title":"Espnet: End-to-end speech processing toolkit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.988307Z"},"links":{"cited_paper":"/paper/1804.00015","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:be0c142ce3d7f47c316a79aafd533d420b95c59f538b95ac927fd7f081e942b5","observation_id":"d40119a5-eb01-4f5b-8546-594e81ab0c35","resolution":{"observed_at":"2026-08-11T21:30:10.988307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-11T21:30:10.997692Z","title":"Superb: Speech processing universal performance benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.997692Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:27c7e6b86ecb54a5f1f36c3e559e0799a3aff68c82b30ca1c44886aad91226c6","observation_id":"7f08a44d-91ff-4e09-8a10-aea7e0730d3b","resolution":{"observed_at":"2026-08-11T21:30:10.997692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-11T21:30:11.003867Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:11.003867Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:193ec35997101aecd9b0cffa904f37a1a29958029fcd116f061ac544fc479190","observation_id":"f4a3b4a6-fe09-409a-a9be-767fa5445740","resolution":{"observed_at":"2026-08-11T21:30:11.003867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12233","last_updated":"2022-02-28T11:50:57Z","snapshot_observed_at":"2026-08-11T00:22:32.322371Z","submitted_at":"2022-02-24T17:55:00Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12233","snapshot_observed_at":"2026-08-11T21:30:10.957252Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.957252Z"},"links":{"cited_paper":"/paper/2202.12233","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:aa58ae3826b82f1cd360bcc29368f55775996402c6f79c78e91abbfef7353a56","observation_id":"2ff224b9-b768-4bd1-be8e-4a95eec8f86c","resolution":{"observed_at":"2026-08-11T21:30:10.957252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08352","last_updated":"2022-05-04T18:16:38Z","snapshot_observed_at":"2026-08-11T00:21:39.313676Z","submitted_at":"2021-12-15T18:56:35Z","title":"Textless Speech-to-Speech Translation on Real Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08352","snapshot_observed_at":"2026-08-11T21:30:10.913127Z","title":"Textless speech-to-speech translation on real data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.913127Z"},"links":{"cited_paper":"/paper/2112.08352","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:d139c6ea0fa587defd6d18bdd2372097e13053a3a2471d9a89cda449a9b1c2bc","observation_id":"f4dced0f-5f99-4313-98ca-eee49c072582","resolution":{"observed_at":"2026-08-11T21:30:10.913127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.505074Z","title":"The 2021 NIST Speaker Recognition Evaluation","venue":null,"work_id":"081398f1-5893-459c-b617-93e56f671944","year":2021},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.930987Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:711584d8250f994432da7f163b30ace541e1271eddded0f485e6821a0bfc4892","observation_id":"756c2db5-d429-4a06-97a8-49096862f754","resolution":{"observed_at":"2026-08-11T21:30:11.510249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:10.880147Z","title":"Brecht Desplanques, Jenthe Thienpondt, and Kris Demuynck","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.880147Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:bc48664e677617d8a75ed637acadba75f3cb7b6b588f1ef19f04189d2064e2cc","observation_id":"8f9fa22a-a421-46fd-bbe6-0ca8d36b1cb3","resolution":{"observed_at":"2026-08-11T21:30:10.880147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.582986Z","title":"Accidental learners: Spoken language identification in multilingual self-supervised models","venue":null,"work_id":"5f226f47-a647-438f-8fb4-457fc1f2146e","year":2023},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.864310Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:8d8f3f4ce1a22e1aa79efbdbe8a78805bd6e74c208793feb043be1bd21082228","observation_id":"161d052b-b784-4154-93af-bc289dda90c5","resolution":{"observed_at":"2026-08-11T21:30:11.589218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12765","last_updated":"2022-06-27T13:49:53Z","snapshot_observed_at":"2026-07-06T13:04:13.261577Z","submitted_at":"2022-04-27T08:35:57Z","title":"Why does Self-Supervised Learning for Speech Recognition Benefit Speaker Recognition?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12765","snapshot_observed_at":"2026-08-11T21:30:10.874720Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.874720Z"},"links":{"cited_paper":"/paper/2204.12765","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:dd5c100160853fa0b6f3fec33159167fbf086ff8555dfd11e5eedfa8018f9a7e","observation_id":"388d175f-7dd6-41ec-85fb-bb94691bb1dc","resolution":{"observed_at":"2026-08-11T21:30:10.874720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/odyssey.2022-45","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.067548Z","title":"Ramon Sanabria and Florian Metze","venue":null,"work_id":"b5adfdd6-06eb-4800-842b-1653fbb42d0e","year":2022},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.938234Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:034155697a9528dc63266ca0b69db8feb57ffb850885c8507071313fe287bdfe","observation_id":"7583da53-64a5-4ba3-a19a-437816a80755","resolution":{"observed_at":"2026-08-11T21:30:11.074147Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:30:11.563509Z","title":"An exploration of self- supervised pretrained representations for end-to-end speech recognition","venue":null,"work_id":"21ad779b-6e22-480c-99a1-26ba65f2d200","year":2021},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.869151Z"},"links":{"citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:3294a2fea0c7a1611098ed78d67798721ccddca946eda1f1bfaf7ca7a5b62c94","observation_id":"ce85c26e-009e-4c38-95ff-ac18a7b5f398","resolution":{"observed_at":"2026-08-11T21:30:11.569699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2412.04425."}