{"as_of":"2026-08-20T10:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9618cddb547d6a581506e3030b117884616c5ce8099a9adfef7623963700de4b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:05:11.436227Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:08:37.813294Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-12T11:30:04.920547Z","title":"NISQA: A deep CNN- self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18222","last_updated":"2024-11-27T10:58:13Z","snapshot_observed_at":"2026-08-19T22:22:40.727995Z","submitted_at":"2024-11-27T10:58:13Z","title":"Towards Improved Objective Perceptual Audio Quality Assessment -- Part 1: A Novel Data-Driven Cognitive Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:04.920547Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2411.18222"},"observation_digest":"sha256:53d586a71efca1039417b3f22a357da8d71ce7e81c9bb80c329421e831c4de24","observation_id":"be99caf8-6851-409d-8e79-0bcec4553505","resolution":{"observed_at":"2026-08-12T11:30:04.920547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-10T14:21:56.879183Z","title":"Mittag, B","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-19T01:21:28.929963Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.879183Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:7c502f39d23fce89d3468520162cd6cd0a4479e4b67bf2629c2b0b0e8b0310e1","observation_id":"772a9847-6895-4a12-a802-c361164763e7","resolution":{"observed_at":"2026-08-10T14:21:56.879183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-10T12:30:52.089145Z","title":"Nisqa: A deep cnn-self- attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.17202","last_updated":"2025-03-12T02:01:46Z","snapshot_observed_at":"2026-08-19T19:12:27.978893Z","submitted_at":"2025-01-27T22:47:51Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T12:30:52.089145Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2501.17202"},"observation_digest":"sha256:28cb4a4901ce301deebb52419f2134f409f1cf57fcd4217e82af9a79ad3207ca","observation_id":"be93759f-f1ab-42ed-97ef-c47e7ef11280","resolution":{"observed_at":"2026-08-10T12:30:52.089145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-09T05:54:18.656523Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-18T17:13:14.270187Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.656523Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:2d054ad45195b0ebb2ac137902f7f70d2666e2fa5c6136b53100e25d998749af","observation_id":"c12aaf43-7de6-45ee-adfd-7cfa2152ef9d","resolution":{"observed_at":"2026-08-09T05:54:18.656523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-16T06:05:11.436227Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19146","last_updated":"2025-04-27T07:58:56Z","snapshot_observed_at":"2026-08-19T01:11:40.782554Z","submitted_at":"2025-04-27T07:58:56Z","title":"Muyan-TTS: A Trainable Text-to-Speech Model Optimized for Podcast Scenarios with a $50K Budget","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T06:05:11.436227Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2504.19146"},"observation_digest":"sha256:8b2bb6cde84e75caf5ad2512677141cdb9193ee8f94e123b75874bd04f859a28","observation_id":"0d180f06-89bc-49a4-8a9c-4eeb242cd7b7","resolution":{"observed_at":"2026-08-16T06:05:11.436227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-16T05:37:50.085103Z","title":"NISQA: A deep cnn- self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-18T17:45:13.769932Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.085103Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:f44c1c6431acd90942c50707a9ecad101caa945193ec75555bcbc55792f50de9","observation_id":"1926ba2a-b443-45ad-9567-ba7ca98d6dc9","resolution":{"observed_at":"2026-08-16T05:37:50.085103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-15T20:33:39.467645Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12686","last_updated":"2025-05-19T04:14:58Z","snapshot_observed_at":"2026-08-17T20:23:16.074873Z","submitted_at":"2025-05-19T04:14:58Z","title":"RoVo: Robust Voice Protection Against Unauthorized Speech Synthesis with Embedding-Level Perturbations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:33:39.467645Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2505.12686"},"observation_digest":"sha256:fdb7b84e13ff2e86c5bb68ab47a45798eeb9533ca50d29f78cfb93b9eab54f77","observation_id":"01cb78cd-3329-4f01-bac8-a992308224c2","resolution":{"observed_at":"2026-08-15T20:33:39.467645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-07T14:27:07.110867Z","title":"Nisqa: A deep cnn- self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18864","last_updated":"2025-05-24T20:46:36Z","snapshot_observed_at":"2026-08-19T15:57:21.175415Z","submitted_at":"2025-05-24T20:46:36Z","title":"Audio Jailbreak Attacks: Exposing Vulnerabilities in SpeechGPT in a White-Box Framework","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:07.110867Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2505.18864"},"observation_digest":"sha256:90563bded5efeb1dad813942f43cbbc96657aa2c71269c963658f46f42b57f68","observation_id":"acce009c-0393-49ea-a7a9-d118aa8da34c","resolution":{"observed_at":"2026-08-07T14:27:07.110867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-07T10:17:47.176541Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-17T19:45:22.860227Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":270,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:47.176541Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:3794ae21b5775bb9b00339c7803b8b75eb541605df7a4453871a509d10741af9","observation_id":"c9c1005d-6da5-4701-ad4b-a3d196cfb89f","resolution":{"observed_at":"2026-08-07T10:17:47.176541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-06T16:47:56.738747Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-13T13:24:03.399635Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T16:47:56.738747Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2507.12705"},"observation_digest":"sha256:8c28a72c452f8d9ddef4b1043245639138242cfe84d796f3e4dcf0266662ec7d","observation_id":"07980a83-9295-4dc1-a55c-f5146b5b06e7","resolution":{"observed_at":"2026-08-06T16:47:56.738747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-04T09:12:59.994039Z","title":"Nisqa: A deep cnn-self-attention model for multidimen- sional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.16834","last_updated":"2026-07-22T04:00:42Z","snapshot_observed_at":"2026-08-18T14:01:57.050387Z","submitted_at":"2025-10-19T13:46:13Z","title":"Schr\\\"odinger Bridge Mamba for One-Step Speech Enhancement","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T09:12:59.994039Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2510.16834"},"observation_digest":"sha256:d501ca1be66712c3a3f4374412a12d2cc456bc36743c9fcc33dc138a9bddf77d","observation_id":"66d5267e-3512-4829-a45e-6f977e03a8cb","resolution":{"observed_at":"2026-08-04T09:12:59.994039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":"2104.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-07-03T16:08:37.813294Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494","venue":null,"work_id":"d8870e91-cabb-4a77-9cf7-022f8b8412db","year":2021},"citing_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-08-18T03:03:12.839060Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T00:03:45.576961Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2512.09299"},"observation_digest":"sha256:f983e1ea27a4c8298889c8f458c0ee932720f6fb2997c5ee0c01a8bbd197c0e4","observation_id":"4bc17981-6d85-46b7-9710-5c344c87022d","resolution":{"observed_at":"2026-05-17T00:08:43.842814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-03T14:20:49.194237Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.20978","last_updated":"2026-06-06T11:42:51Z","snapshot_observed_at":"2026-08-19T07:59:48.925532Z","submitted_at":"2025-12-24T06:13:02Z","title":"GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:49.194237Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2512.20978"},"observation_digest":"sha256:d8882f4b7832e3f63f2efa0697f4561c253dc8c284733cc8e23810279d05c3e5","observation_id":"b5c520e3-968d-4498-a4f7-828dc82af443","resolution":{"observed_at":"2026-08-03T14:20:49.194237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-02T18:15:19.385299Z","title":"NISQA: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.13952","last_updated":"2026-07-15T11:15:11Z","snapshot_observed_at":"2026-08-15T15:58:05.539064Z","submitted_at":"2026-03-14T14:01:45Z","title":"LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:19.385299Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2603.13952"},"observation_digest":"sha256:47f23c83127d80a26a9c0f920c7cb30ae7e2baffbe9bdc43c911ae14b765d12f","observation_id":"accabfca-7a05-4f46-97bc-7fe84ad890bc","resolution":{"observed_at":"2026-08-02T18:15:19.385299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":"2104.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-07-03T16:08:37.813294Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494","venue":null,"work_id":"d8870e91-cabb-4a77-9cf7-022f8b8412db","year":2021},"citing_paper":{"arxiv_id":"2604.09371","last_updated":"2026-04-17T03:44:27Z","snapshot_observed_at":"2026-08-13T20:29:55.754524Z","submitted_at":"2026-04-10T14:40:57Z","title":"Discrete Token Modeling for Multi-Stem Music Source Separation with Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T16:28:06.677963Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2604.09371"},"observation_digest":"sha256:7bd5b6f2962d80171677d4f9ef81a6e1f8fb13d5274ce048284b558931fae25c","observation_id":"6fba3f46-deb1-4120-b68d-1e010ce83738","resolution":{"observed_at":"2026-05-11T08:50:58.421331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":"2104.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-07-03T16:08:37.813294Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494","venue":null,"work_id":"d8870e91-cabb-4a77-9cf7-022f8b8412db","year":2021},"citing_paper":{"arxiv_id":"2605.00861","last_updated":"2026-04-21T10:34:41Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-04-21T10:34:41Z","title":"Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T01:07:50.243903Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2605.00861"},"observation_digest":"sha256:fbda6fffa1ffa96b04ee237bda6c31c0b1fdec700f7c0472574b39b0bc70b5a2","observation_id":"286239c9-47a8-4c7a-ae16-bbadbbfbeb63","resolution":{"observed_at":"2026-05-10T01:10:09.297512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":"2104.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-07-03T16:08:37.813294Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494","venue":null,"work_id":"d8870e91-cabb-4a77-9cf7-022f8b8412db","year":2021},"citing_paper":{"arxiv_id":"2605.04505","last_updated":"2026-05-06T05:18:42Z","snapshot_observed_at":"2026-08-11T06:20:33.479992Z","submitted_at":"2026-05-06T05:18:42Z","title":"JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T16:43:33.397158Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2605.04505"},"observation_digest":"sha256:9d58ae049f3b5d7b022b343b9782b2dccc9ff73ecd29fd3c1e2327bfd37ad20d","observation_id":"d1606140-ce0a-4f09-a6dc-4b181af79233","resolution":{"observed_at":"2026-05-11T18:01:08.365461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":"2104.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-07-03T16:08:37.813294Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494","venue":null,"work_id":"d8870e91-cabb-4a77-9cf7-022f8b8412db","year":2021},"citing_paper":{"arxiv_id":"2605.16681","last_updated":"2026-08-16T00:07:27Z","snapshot_observed_at":"2026-08-20T08:12:46.628759Z","submitted_at":"2026-05-15T22:34:52Z","title":"A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T20:26:59.049472Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2605.16681"},"observation_digest":"sha256:07e1322df90d6473a7f57ea3b505508b1d1ebc17431ee254717158901d730a95","observation_id":"acb0c766-be82-4ead-aa38-b0a6b470f1f4","resolution":{"observed_at":"2026-05-19T20:27:53.833743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":"2104.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-07-03T16:08:37.813294Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494","venue":null,"work_id":"d8870e91-cabb-4a77-9cf7-022f8b8412db","year":2021},"citing_paper":{"arxiv_id":"2606.05678","last_updated":"2026-06-04T04:00:48Z","snapshot_observed_at":"2026-08-16T03:28:58.316103Z","submitted_at":"2026-06-04T04:00:48Z","title":"Beyond Waveform Robustness: Robust Feature-Vocoder Adversarial Attacks on Automatic Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T00:09:19.291564Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2606.05678"},"observation_digest":"sha256:3b33990ce1eb75aa9e77be25da2cd8dd00091e6222b1ce4d9249826d7277b67c","observation_id":"fd924b34-dd36-43b5-8c1a-a366a3914541","resolution":{"observed_at":"2026-07-02T14:47:04.326382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":"2104.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-07-03T16:08:37.813294Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494","venue":null,"work_id":"d8870e91-cabb-4a77-9cf7-022f8b8412db","year":2021},"citing_paper":{"arxiv_id":"2606.11828","last_updated":"2026-06-10T09:06:37Z","snapshot_observed_at":"2026-08-14T10:46:05.722200Z","submitted_at":"2026-06-10T09:06:37Z","title":"Feature-Aligned Speech Watermarking for Robustness to Reconstruction Distortions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T08:27:00.881610Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2606.11828"},"observation_digest":"sha256:d3207c6f5d38ff3120321c28e8403b1fbbdd97741d21bd31f5750756d5413911","observation_id":"b6454594-db1d-4567-bde7-bf1accec18b5","resolution":{"observed_at":"2026-07-03T13:08:08.739075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":"2104.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-07-03T16:08:37.813294Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494","venue":null,"work_id":"d8870e91-cabb-4a77-9cf7-022f8b8412db","year":2021},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-17T17:41:52.942327Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:326c55fd87ce0efba8e29373bab0538f5d03ad1e778e0850783bd6c1e640883f","observation_id":"c8922d62-d0fb-4c6a-990d-4c59296eed29","resolution":{"observed_at":"2026-07-03T16:08:37.814833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-01T14:51:46.710045Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18629","last_updated":"2026-07-21T01:54:51Z","snapshot_observed_at":"2026-08-15T11:34:10.893917Z","submitted_at":"2026-07-21T01:54:51Z","title":"CS-ETS: Chaos-Inspired Samba-Based EMG-To-Speech Synthesis with Nonlinear Chaotic Losses","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T14:51:46.710045Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2607.18629"},"observation_digest":"sha256:9425ad6d78194de0d798eb5ff34d9967687bb748634550bb2767e771e94ec123","observation_id":"a3de0a8f-1d1c-4804-bd6a-984d304ecd90","resolution":{"observed_at":"2026-08-01T14:51:46.710045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-06T00:41:58.389986Z","title":"arXiv preprint arXiv:2104.09494 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01033","last_updated":"2026-08-02T06:31:25Z","snapshot_observed_at":"2026-08-15T13:15:04.773102Z","submitted_at":"2026-08-02T06:31:25Z","title":"CallScreenBench: Benchmarking On-Device Models as Phone Secretaries","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T00:41:58.389986Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2608.01033"},"observation_digest":"sha256:d4a9526e6a52832935be43af28bdb61ec8176271e4fe21eb5bd0bf2a417873d6","observation_id":"cb0b5c6e-2eb4-4a5e-9dac-db672dcc5553","resolution":{"observed_at":"2026-08-06T00:41:58.389986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-11T04:16:51.721966Z","title":"InPro- ceedings of the 19th Conference of the European Chapter of the Association for Computational Lin- guistics (V olume 1: Long Papers), pages 3644–3663","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09930","last_updated":"2026-08-10T17:59:51Z","snapshot_observed_at":"2026-08-14T15:43:01.179338Z","submitted_at":"2026-08-10T17:59:51Z","title":"Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T04:16:51.721966Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2608.09930"},"observation_digest":"sha256:4630990ccb2f5bfca3286c75fe76e6f94965c91d26925052168f3dbf541d5e97","observation_id":"19601c4e-067d-4dc4-ac06-f51e5edc8609","resolution":{"observed_at":"2026-08-11T04:16:51.721966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2104.09494/citation-record","integrity":"/paper/2104.09494/integrity","json":"/paper/2104.09494/citation-record.json","paper":"/paper/2104.09494"},"outbound":[],"paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2104.09494."}