{"as_of":"2026-08-12T07:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dba871f787e2fdd52e1054b802742ce0d4503c4d002e8f2e7a62d63b6b09f0b3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:30:10.997692Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T14:53:55.761527Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-11T21:30:10.997692Z","title":"Superb: Speech processing universal performance benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04425","last_updated":"2024-12-05T18:51:10Z","snapshot_observed_at":"2026-08-12T05:30:44.202497Z","submitted_at":"2024-12-05T18:51:10Z","title":"CA-SSLR: Condition-Aware Self-Supervised Learning Representation for Generalized Speech Processing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:30:10.997692Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2412.04425"},"observation_digest":"sha256:27c7e6b86ecb54a5f1f36c3e559e0799a3aff68c82b30ca1c44886aad91226c6","observation_id":"7f08a44d-91ff-4e09-8a10-aea7e0730d3b","resolution":{"observed_at":"2026-08-11T21:30:10.997692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-11T17:24:22.432903Z","title":"Superb: Speech processing universal performance benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-12T05:28:06.409447Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.432903Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:9948eab477cb20a114d7054181a23dde5dea7a591c625cf316615b3dec5700ea","observation_id":"aa365929-7583-4da4-924a-e36fdb2f6d70","resolution":{"observed_at":"2026-08-11T17:24:22.432903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-10T18:06:18.040748Z","title":"Yang, P.-H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11631","last_updated":"2025-01-20T18:01:42Z","snapshot_observed_at":"2026-08-12T02:44:41.725953Z","submitted_at":"2025-01-20T18:01:42Z","title":"Noise-Agnostic Multitask Whisper Training for Reducing False Alarm Errors in Call-for-Help Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:06:18.040748Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2501.11631"},"observation_digest":"sha256:5456ea04449517a971f98e2f30b8bc06a14a414d9c190d7a114d413affb89e35","observation_id":"482a3266-c427-437a-8a90-2b17a9a8bf9d","resolution":{"observed_at":"2026-08-10T18:06:18.040748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-10T14:36:19.889484Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-10T17:21:32.264725Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.889484Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:e29e182dfdf16d170be83444dd657ee5291979711a928488669326e192fe1458","observation_id":"0d6ff449-43b6-4c1b-8bc7-29e7b25f4afd","resolution":{"observed_at":"2026-08-10T14:36:19.889484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-09T19:16:37.865512Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00377","last_updated":"2025-02-01T09:29:21Z","snapshot_observed_at":"2026-08-10T18:31:30.108616Z","submitted_at":"2025-02-01T09:29:21Z","title":"When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T19:16:37.865512Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2502.00377"},"observation_digest":"sha256:94738382825d4bc55ff39c41e9476d4cecd7de7331524a630800fbe0466b50ad","observation_id":"36a1a052-2da7-43d5-a94e-3fa582a15f61","resolution":{"observed_at":"2026-08-09T19:16:37.865512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-09T04:35:12.644162Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03559","last_updated":"2025-02-07T16:51:57Z","snapshot_observed_at":"2026-08-10T11:32:08.223522Z","submitted_at":"2025-02-05T19:17:24Z","title":"Comprehensive Layer-wise Analysis of SSL Models for Audio Deepfake Detection","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T04:35:12.644162Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2502.03559"},"observation_digest":"sha256:844abca4abd2162f8dde10be2fd3cd6331e9d746fa40cafa0334cabf0b933f24","observation_id":"784e7f01-6faf-43e2-a3e3-16adc5fa465a","resolution":{"observed_at":"2026-08-09T04:35:12.644162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T15:07:32.131218Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16212","last_updated":"2025-05-24T20:25:08Z","snapshot_observed_at":"2026-08-10T04:52:13.110521Z","submitted_at":"2025-05-22T04:28:02Z","title":"Large Language Models based ASR Error Correction for Child Conversations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:32.131218Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2505.16212"},"observation_digest":"sha256:138e40cabea9a3cd120727183e5b2df4a49b5565ec2a875c47f4f73b2e2d659e","observation_id":"91d0c985-1dcc-433f-9059-aaa8909fc1e0","resolution":{"observed_at":"2026-08-07T15:07:32.131218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T14:12:47.829556Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-11T18:07:40.358368Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.829556Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:e7a8c61d8b7d014a3db4eed0bfdf8cf78822449a234591762c61437eb17b47c3","observation_id":"c822dc6b-1ea6-4b31-a86a-eea374679c94","resolution":{"observed_at":"2026-08-07T14:12:47.829556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2505.22765","last_updated":"2026-04-07T15:07:17Z","snapshot_observed_at":"2026-08-11T13:22:19.620499Z","submitted_at":"2025-05-28T18:32:56Z","title":"StressTest: Can YOUR Speech LM Handle the Stress?","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T13:00:23.002962Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2505.22765"},"observation_digest":"sha256:81c3ea0d561f6b8970d64d56c7ca325abfafaab13624cfc1933c24bd3968d04e","observation_id":"23de2174-1071-4659-8a82-a16a72715415","resolution":{"observed_at":"2026-05-19T13:02:18.245043Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T11:46:59.069395Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01496","last_updated":"2025-06-03T10:16:03Z","snapshot_observed_at":"2026-08-11T05:16:21.684029Z","submitted_at":"2025-06-02T09:59:35Z","title":"Continual Speech Learning with Fused Speech Features","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:46:59.069395Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2506.01496"},"observation_digest":"sha256:4c35c24ea1e8e4af4c78b461f10dd09e82e30100182b14d8a7e5e2ddb61a125d","observation_id":"b7fa7fea-a8de-4bd5-b118-5815cf44f159","resolution":{"observed_at":"2026-08-07T11:46:59.069395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T04:32:30.437423Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.437423Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:e3e841324f14c633b44d9b208c3c909c87aafc35ec9dc02e72cdd19fff9fe8b7","observation_id":"d8de2a0e-6168-4d88-ab94-a6a625aaacae","resolution":{"observed_at":"2026-08-07T04:32:30.437423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T20:58:31.169287Z","title":"Superb: Speech processing universal performance benchmark.arXiv preprint arXiv:2105.01051, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-10T11:06:24.037817Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.169287Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:6fc10543e143704407a4d751b3af9a5cafc3c534fd01a473e080436a24399ac1","observation_id":"f4a97ade-ec12-49e6-9a14-2af222fe9663","resolution":{"observed_at":"2026-08-06T20:58:31.169287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T16:47:59.287586Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-09T16:46:59.928558Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:47:59.287586Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.12705"},"observation_digest":"sha256:d2510ee33ce1ed9d3497a1d3854842981e7cfb120fda18c699c2d3f9cc6d0b50","observation_id":"724aaa79-c9b0-4550-bf4b-3bd285639038","resolution":{"observed_at":"2026-08-06T16:47:59.287586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T17:26:27.022505Z","title":"arXiv preprint arXiv:2105.01051 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16834","last_updated":"2025-07-15T03:42:05Z","snapshot_observed_at":"2026-08-10T18:31:56.424795Z","submitted_at":"2025-07-15T03:42:05Z","title":"Towards Robust Speech Recognition for Jamaican Patois Music Transcription","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:27.022505Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.16834"},"observation_digest":"sha256:899636766a5eca2d7c460b0863cf93ab4e21e15d59429858d2aaed27e234c1e6","observation_id":"07b7f3c5-28e0-411e-80db-09449c0dffa8","resolution":{"observed_at":"2026-08-06T17:26:27.022505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T11:07:20.126818Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-10T09:51:03.085124Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.126818Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:b7ba2ec7f5f772bf280f3ca238f22ac80db56e2d73952168751c2a5197edc87d","observation_id":"4660fb3d-fdf7-40e6-89ae-fe74d8854c43","resolution":{"observed_at":"2026-08-06T11:07:20.126818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T19:54:58.546041Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11598","last_updated":"2025-08-15T17:06:04Z","snapshot_observed_at":"2026-08-07T23:10:02.754274Z","submitted_at":"2025-08-15T17:06:04Z","title":"Representing Speech Through Autoregressive Prediction of Cochlear Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T19:54:58.546041Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.11598"},"observation_digest":"sha256:e99badc16ae6d4f7c43ea854380ec81c69be75fb10bfdcbdbebadbb978fdb5f7","observation_id":"d35525ca-2a30-43d0-9329-ae571f573311","resolution":{"observed_at":"2026-08-05T19:54:58.546041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T19:46:48.209823Z","title":"Superb: Speech processing universal performance benchmark.arXiv preprint arXiv:2105.01051,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11838","last_updated":"2025-09-08T04:00:52Z","snapshot_observed_at":"2026-08-09T09:50:50.191173Z","submitted_at":"2025-08-15T23:15:50Z","title":"Deformation Driven Suction Cups: A Mechanics-Based Approach to Wearable Electronics","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T19:46:48.209823Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.11838"},"observation_digest":"sha256:64e8a16368c6c0f40cf8f76f880e4c6fe9e049826e9d6709d6da37b3b73d2d34","observation_id":"b381d03e-da15-48d3-bd19-0adf626e619d","resolution":{"observed_at":"2026-08-05T19:46:48.209823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2508.11845","last_updated":"2026-05-14T16:33:16Z","snapshot_observed_at":"2026-08-03T02:12:51.182664Z","submitted_at":"2025-08-15T23:52:34Z","title":"AVEX: What Matters for Animal Vocalization Encoding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T22:15:48.885339Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.11845"},"observation_digest":"sha256:2bfde550bf1ec1348bb538d9aedaee275f9b40fd938bbd072597d44a1c477900","observation_id":"925214f4-052a-4fc9-9a96-b3d59c39ffe5","resolution":{"observed_at":"2026-05-18T22:16:51.709697Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T19:39:22.296512Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12221","last_updated":"2025-08-17T03:32:02Z","snapshot_observed_at":"2026-08-05T19:39:20.254888Z","submitted_at":"2025-08-17T03:32:02Z","title":"Multiple-Noise-Resilient Nonadiabatic Geometric Quantum Control of Solid-State Spins in Diamond","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:22.296512Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2508.12221"},"observation_digest":"sha256:f72a4993fa52f6af1ac578ee1a04b8e271a5120cf9c6aa6406ff1346e1dffa1e","observation_id":"5f4738f6-a9f9-4743-b03f-76a552e53c59","resolution":{"observed_at":"2026-08-05T19:39:22.296512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T11:41:02.892997Z","title":"J.; Lakhotia, K.; Lin, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.02349","last_updated":"2025-09-04T14:25:57Z","snapshot_observed_at":"2026-08-12T06:36:43.949742Z","submitted_at":"2025-09-02T14:15:22Z","title":"AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:02.892997Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2509.02349"},"observation_digest":"sha256:1e3eec733cffa91930e141bb45288c9cb8e599542e8f61ccb18b701ad201a671","observation_id":"5d9a2068-4691-4b0e-a7a7-c09ff5e2cc0c","resolution":{"observed_at":"2026-08-05T11:41:02.892997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:cffb76d6f2894c8e648b882d85da6bb3f52b4b6af0bd68f9ac2b766a9309f477","observation_id":"a697c031-e64b-4621-b4ed-b4c604146834","resolution":{"observed_at":"2026-05-18T18:11:42.900862Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-13T16:09:50.207908Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.28737","last_updated":"2026-06-20T22:01:30Z","snapshot_observed_at":"2026-08-07T03:32:35.423463Z","submitted_at":"2026-03-30T17:50:07Z","title":"ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T16:09:50.207908Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2603.28737"},"observation_digest":"sha256:5ecbe2ee62899bf8c2d1bd1db19329c722182ab81685d0f7c1b3672d278dee6e","observation_id":"f984d490-1f1f-4575-8b54-3c91fb536ed3","resolution":{"observed_at":"2026-07-13T16:09:50.207908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2604.06702","last_updated":"2026-04-08T05:42:03Z","snapshot_observed_at":"2026-08-11T13:27:24.975556Z","submitted_at":"2026-04-08T05:42:03Z","title":"ULTRAS -- Unified Learning of Transformer Representations for Audio and Speech Signals","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:30:30.431777Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2604.06702"},"observation_digest":"sha256:e6310e06e2c2eef163230ad3cdafa926c32d01d93d35769b7e815a66069b2045","observation_id":"9102b529-8e2c-43ce-90e9-6f0d6c407315","resolution":{"observed_at":"2026-05-11T00:25:54.281562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.00251","last_updated":"2026-04-30T21:32:40Z","snapshot_observed_at":"2026-08-06T03:10:18.640256Z","submitted_at":"2026-04-30T21:32:40Z","title":"Alethia: A Foundational Encoder for Voice Deepfakes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:59.124425Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.00251"},"observation_digest":"sha256:4c3314c75ea91f7a3c896ecc225bd8b087a26334aa4bf252c221adb21ee7c31d","observation_id":"1d174128-92b1-4b5d-90be-656fa86a94bc","resolution":{"observed_at":"2026-05-11T15:41:33.505238Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.10494","last_updated":"2026-05-11T12:52:29Z","snapshot_observed_at":"2026-08-09T23:13:14.574479Z","submitted_at":"2026-05-11T12:52:29Z","title":"Multi-layer attentive probing improves transfer of audio representations for bioacoustics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:11:17.994180Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.10494"},"observation_digest":"sha256:6ad9b3e65817d3ab0a93ab1cf69539f4c91ab22c6aeefb468404ef2f28ebc044","observation_id":"2e8d27b2-891d-4f3f-bca1-e5eff96c860f","resolution":{"observed_at":"2026-05-12T06:31:28.421913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.14231","last_updated":"2026-05-14T00:56:51Z","snapshot_observed_at":"2026-08-11T08:40:42.838855Z","submitted_at":"2026-05-14T00:56:51Z","title":"AudioMosaic: Contrastive Masked Audio Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T01:52:01.164694Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.14231"},"observation_digest":"sha256:615b9b54fb90157d690770218793580005f8ebfb57f0206e3a804cefd1045442","observation_id":"4bcd3ac3-e213-4e36-8687-991e32b4b297","resolution":{"observed_at":"2026-05-15T01:53:28.854680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.17152","last_updated":"2026-05-16T20:56:15Z","snapshot_observed_at":"2026-08-02T18:07:50.795904Z","submitted_at":"2026-05-16T20:56:15Z","title":"Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages","version":1},"reference_index":228,"source":"arxiv_source","source_observed_at":"2026-05-20T14:33:36.100966Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.17152"},"observation_digest":"sha256:dcee8ca348d1635795ac6aad6ea22c8bf016a4641d98bad2d5290a5bc91631de","observation_id":"458ee8da-b048-4de5-9728-65bcad93a99e","resolution":{"observed_at":"2026-05-20T14:38:21.758423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:866a4279b5aab7d2f4e85d08437112e53c9885eab99f5494601451f115bd4278","observation_id":"26975453-eb90-4d85-87ab-71f476c7aee6","resolution":{"observed_at":"2026-07-01T20:16:12.193979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-08-06T23:00:35.099926Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:c7afc3e99283e2e542f3676676552afaca6815ea0384092755a97408cbbf2249","observation_id":"82c14792-db0e-40de-9be4-3c637d99cb18","resolution":{"observed_at":"2026-07-02T00:56:25.070239Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.06837","last_updated":"2026-06-05T02:24:19Z","snapshot_observed_at":"2026-08-06T02:56:00.329851Z","submitted_at":"2026-06-05T02:24:19Z","title":"SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T21:19:56.932689Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.06837"},"observation_digest":"sha256:1fe921406f6485b5e2a13cce0a5991aa067b78b8a366fa70662398c3bbac882e","observation_id":"3342e72b-077b-4df4-ae0a-95680c353790","resolution":{"observed_at":"2026-07-02T19:47:19.562187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.19398","last_updated":"2026-06-17T08:39:09Z","snapshot_observed_at":"2026-08-06T17:30:32.172998Z","submitted_at":"2026-06-17T08:39:09Z","title":"S-JEPA : Soft Clustering Anchors for Self-Supervised Speech Representation Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T19:46:47.653439Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.19398"},"observation_digest":"sha256:b6704607b06ec92bf37dc3f4b6c05720fe24b45b09ae43a8fd6a5e6a4bffe7bf","observation_id":"2906d0af-dab0-419d-b7fb-6f3e014dc63a","resolution":{"observed_at":"2026-07-04T02:19:24.216627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.21210","last_updated":"2026-06-26T13:32:46Z","snapshot_observed_at":"2026-08-08T14:43:47.552914Z","submitted_at":"2026-06-19T08:26:11Z","title":"Impact Analysis of Speech Representation Learning Models for Acoustic Side-Channel Attack","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T14:19:59.573391Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.21210"},"observation_digest":"sha256:1ceaa11bc2537d395f0d42862142a83f959e52c946ec013d7bad0cb81f529e59","observation_id":"fdcd89da-18a7-46e6-8099-6ac99c19f2e2","resolution":{"observed_at":"2026-07-04T06:39:37.328046Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.21210","last_updated":"2026-06-26T13:32:46Z","snapshot_observed_at":"2026-08-08T14:43:47.552914Z","submitted_at":"2026-06-19T08:26:11Z","title":"Impact Analysis of Speech Representation Learning Models for Acoustic Side-Channel Attack","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T04:44:52.537405Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.21210"},"observation_digest":"sha256:6aedc64caed38bfe9ffc9584dc2093d23c9bd330f71b9c1f874e739c77392fee","observation_id":"c6760762-9e33-4456-8c11-2dda8ff85c86","resolution":{"observed_at":"2026-06-29T19:33:54.408623Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.22868","last_updated":"2026-06-22T05:24:35Z","snapshot_observed_at":"2026-08-09T18:53:08.114092Z","submitted_at":"2026-06-22T05:24:35Z","title":"MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T07:36:34.307652Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.22868"},"observation_digest":"sha256:86be27c73348e8446673e7ae52ca3d72b00ac25a701aeb6697894763cade3119","observation_id":"e04976fb-eddd-48d7-817e-3474b7469bb9","resolution":{"observed_at":"2026-07-04T11:49:50.798715Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.24910","last_updated":"2026-06-19T08:07:13Z","snapshot_observed_at":"2026-08-06T07:38:22.689273Z","submitted_at":"2026-06-19T08:07:13Z","title":"End-to-End Voice Intent Recognition for Spontaneous Human-Drone Interaction with Naive Users","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T13:30:12.101045Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.24910"},"observation_digest":"sha256:c6199f2614cfe9e11b0e8037b19b2d7c6a97523b4bc37a9085d6a794f0930cc9","observation_id":"cd021a1a-d2c2-4ef3-a5e2-6faea7688acd","resolution":{"observed_at":"2026-07-04T07:29:38.212507Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2606.30550","last_updated":"2026-06-29T16:48:21Z","snapshot_observed_at":"2026-08-05T08:13:09.099537Z","submitted_at":"2026-06-29T16:48:21Z","title":"SIGMA: Saliency-Guided Sparse Mask Attacks for Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T04:44:59.279562Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2606.30550"},"observation_digest":"sha256:dbcd3d94a134b7e37c7f9a1a318300228ae31ca6000f2539cb2903d86cc15010","observation_id":"15289bd6-f251-4997-93be-5a9d1e8d1798","resolution":{"observed_at":"2026-06-30T16:24:57.677906Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:d944e5d6305d045b67713086ad32d064a23b35a868229e5f4646c1e3a2f168f4","observation_id":"f5bf67c4-e13c-4e07-ba87-265be4b59ea9","resolution":{"observed_at":"2026-07-02T05:56:39.882231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-02T09:53:17.632449Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:0abfe39fef6097bcedbb4030ba828e3250f492b7e8cb3ab28c0d22be23e13e55","observation_id":"7963645b-9cd7-4068-b5d1-df5bcd427f8c","resolution":{"observed_at":"2026-07-07T14:53:55.763035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-01T02:57:44.725464Z","title":"SUPERB: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25284","last_updated":"2026-07-28T04:42:05Z","snapshot_observed_at":"2026-08-08T01:46:13.862673Z","submitted_at":"2026-07-28T04:42:05Z","title":"Multi-Phonation Graph Learning with Self-Supervised Speech Embeddings for ALS Detection and Progression Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:44.725464Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2607.25284"},"observation_digest":"sha256:2c4b4684c0b423c9cd1c8f838669274001567a425de8602b9e66e9d6e3ba3ed9","observation_id":"b307710e-4c92-4ad4-8562-05cadfad0ae0","resolution":{"observed_at":"2026-08-01T02:57:44.725464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-05T15:52:34.565904Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03623","last_updated":"2026-08-06T17:30:44Z","snapshot_observed_at":"2026-08-10T10:42:04.968756Z","submitted_at":"2026-08-04T13:12:41Z","title":"Speaker Verification Under Real Classroom Conditions for English Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:34.565904Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2608.03623"},"observation_digest":"sha256:ca9873ef46558dc04fb4b6d53afdcd40fb29de0a16c76a471b5ed3bb013a37ac","observation_id":"00876789-57bd-4e7b-8726-22dd09ef36fa","resolution":{"observed_at":"2026-08-05T15:52:34.565904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2105.01051/citation-record","integrity":"/paper/2105.01051/integrity","json":"/paper/2105.01051/citation-record.json","paper":"/paper/2105.01051"},"outbound":[],"paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T18:31:07.739445Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2105.01051."}