{"as_of":"2026-08-20T09:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:afbe58628b278a2ac36060d2877460a24525e4ec84674106878ccea5b08dccbe","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:02:45.995503Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T12:03:11.243693Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:21:09.992559Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"cited_work":{"arxiv_id":"2505.11200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11200","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio Turing test: Benchmarking the human-likeness of large language model-based text-to-speech systems in Chinese","venue":null,"work_id":"97a57cf2-e47f-4019-95a9-50e283259e0c","year":2025},"citing_paper":{"arxiv_id":"2604.22225","last_updated":"2026-04-24T05:01:55Z","snapshot_observed_at":"2026-08-15T03:59:58.416838Z","submitted_at":"2026-04-24T05:01:55Z","title":"TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T12:03:11.243693Z"},"links":{"cited_paper":"/paper/2505.11200","citing_paper":"/paper/2604.22225"},"observation_digest":"sha256:88fe9a0253db3db57e5fc8d2248289af24c78bd71a17d2ba54015417ea08e0c7","observation_id":"d1e43662-3b5f-4805-b13a-e882f93a10a2","resolution":{"observed_at":"2026-05-11T19:21:09.999306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11200/citation-record","integrity":"/paper/2505.11200/integrity","json":"/paper/2505.11200/citation-record.json","paper":"/paper/2505.11200"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.908519Z","title":"The kendall rank correlation coefficient","venue":null,"work_id":"bffd3117-5dde-4f19-adbf-a19f35f66982","year":2007},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.452290Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:cc8685d5f3488970cdc8436c6f3f2dcbb782f3b100af671d54986d4eb51b0848","observation_id":"d12e0eee-0575-4604-92f3-acec6972d62a","resolution":{"observed_at":"2026-08-15T21:02:47.916722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-15T21:02:45.460507Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.460507Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:fad3dca104225440ec8a5aafc5d9eb55cee62a342a96ee136d71870df4984f3c","observation_id":"78e42f87-1c18-4a06-bbc6-b9bf84f4f46d","resolution":{"observed_at":"2026-08-15T21:02:45.460507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.875409Z","title":"The t05 system for the voicemos challenge 2024: Transfer learning from deep image classifier to naturalness mos prediction of high-quality synthetic speech","venue":null,"work_id":"6bfbec2a-23a4-4dfd-806b-04b7874c66b1","year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.474393Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:ec5af6d8e8b0d5850bee99e7e81629e3a5388685ed6da8b1c0537ed5baabd4b3","observation_id":"49ab2a14-7b56-4a04-961c-c6bec3e765b2","resolution":{"observed_at":"2026-08-15T21:02:47.889436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.844617Z","title":"Generalized linear mixed models: a practical guide for ecology and evolution","venue":null,"work_id":"457708e5-ca58-465e-bbde-6769849bd7f1","year":2009},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.485384Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:66947407773729f36dc4c2d9ee914ab61aecef1f457bd489525d5160ca0336e9","observation_id":"27821350-9168-49bc-855e-bdb93b82c704","resolution":{"observed_at":"2026-08-15T21:02:47.854107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-416","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:46.137413Z","title":"Why we should report the details in subjective evaluation of tts more rigorously","venue":null,"work_id":"33b204aa-2e8c-48ff-bfaf-c857e32709bf","year":2023},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.499141Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:1ebe32eae3d9b31b353c7f859781b13a16ea3d441a0a56530cfdfe1eb1b57ff6","observation_id":"2feb102f-9eb0-4a89-9a40-03be0124b9db","resolution":{"observed_at":"2026-08-15T21:02:46.147655Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T21:02:45.507556Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.507556Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:4f7727a46bf86f7446402768a97816dd9ba22d8a85a6c2ab76504b59374bb20b","observation_id":"34a5caeb-448c-4616-b27d-41c5bec6b7c2","resolution":{"observed_at":"2026-08-15T21:02:45.507556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:45.519126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.519126Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:67092c03cd233a76cddf06eabb945e4e6b4515abd3fc953320efaba161a936ef","observation_id":"54564007-9d02-4775-8abd-164db0a99811","resolution":{"observed_at":"2026-08-15T21:02:45.519126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01102","last_updated":"2025-01-02T06:51:52Z","snapshot_observed_at":"2026-08-18T21:31:07.060512Z","submitted_at":"2025-01-02T06:51:52Z","title":"Disambiguation of Chinese Polyphones in an End-to-End Framework with Semantic Features Extracted by Pre-trained BERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01102","snapshot_observed_at":"2026-08-15T21:02:45.527668Z","title":"Disambiguation of chinese polyphones in an end-to-end framework with semantic features extracted by pre-trained bert","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.527668Z"},"links":{"cited_paper":"/paper/2501.01102","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:5a2102b5674021a15ef96640b972363730d4300aabaf8748bb0f348e37e3da53","observation_id":"bd94a023-0738-4b32-85ff-82892eab48c6","resolution":{"observed_at":"2026-08-15T21:02:45.527668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-15T21:02:45.536218Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.536218Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:6a077de30a6849b90ddeec020618f47362943b453e6f09afadcf49f1435eb75a","observation_id":"c987edd5-03fb-4ff8-bef5-4dd278e08814","resolution":{"observed_at":"2026-08-15T21:02:45.536218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.811830Z","title":"Assessing the impact of contextual framing on subjective tts quality","venue":null,"work_id":"45955c26-495e-4704-8bd5-008847e0cd75","year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.544926Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:ba99a38695376c4b438b98ae5b7e18a8d1098fca3b554f3fb71cd622a24c4f2c","observation_id":"939b2ce8-a515-4760-b107-dd68c9163cea","resolution":{"observed_at":"2026-08-15T21:02:47.824182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.781128Z","title":"The turing test: the first 50 years","venue":null,"work_id":"c3de3a7d-05b3-4399-9304-fff1e4376dd9","year":2000},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.556597Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:9f3f754f2bbcd6f9319814c61241e48ca43732f707dd886d0f191081745eec43","observation_id":"075d394f-af28-4007-8479-c4a61a262681","resolution":{"observed_at":"2026-08-15T21:02:47.789140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.742879Z","title":"Analysis of speaker similarity in the statistical speech synthesis systems using a hybrid approach","venue":null,"work_id":"1be65d5f-1962-4f61-ae6a-4eff008fae4f","year":2012},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.566322Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:c7c768b25a7ec5a8c0189d500292fcb28a285968511af9bf8aa970bcd695c2c2","observation_id":"0bcd6c3c-53d4-4c3a-ae1a-db140529cb68","resolution":{"observed_at":"2026-08-15T21:02:47.754777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T21:02:45.572675Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.572675Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:5ba7f5859206e6496bcfe4bc355ca77697ce54044a60aff674df563f69a9e7b3","observation_id":"3f9bdd01-ed8a-49c2-83cc-865a0096be17","resolution":{"observed_at":"2026-08-15T21:02:45.572675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.701223Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"e2adfc1f-62b1-43f2-8970-51cb3a5a1719","year":2022},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.582227Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:4683f44c79d5e4365821af1d15c4b65509340c6da07ed7b63c4daf487f5df39a","observation_id":"838d049d-4211-44f4-8e20-80ca2dd798ed","resolution":{"observed_at":"2026-08-15T21:02:47.715922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-15T21:02:45.591082Z","title":"Step-audio: Unified understanding and generation in intelligent speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.591082Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:66008b406c3c708fa9346eeb662a9465f4536268d599801097fc0242ab7e3cbf","observation_id":"0873eeb2-a2ab-40a1-97d6-4a8611358ce0","resolution":{"observed_at":"2026-08-15T21:02:45.591082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:45.599714Z","title":"Mm algorithms for generalized bradley-terry models","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.599714Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:5063f4884e126a35acc771b120319c30c00926dbaf000647029e6b75ebb777cf","observation_id":"a2c57a22-089a-4124-a412-99066bacda59","resolution":{"observed_at":"2026-08-15T21:02:45.599714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T21:02:45.608954Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.608954Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:f0b35258a8b8a22f52b2d85c63c1b33d6e529a9ec3d4609681eafcb9e502ed76","observation_id":"fc5ef76a-f15e-4309-ab88-086bec1649de","resolution":{"observed_at":"2026-08-15T21:02:45.608954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.623351Z","title":"Method for the Subjective Assessment of Intermediate Quality Level of Audio Systems, 2015","venue":null,"work_id":"67e701c9-2e4a-4809-9baf-67034a70db1c","year":2015},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.617482Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:80464687d22d4b1b23b183b7e2ebb78592a37d96db1593266773abcb9da855ea","observation_id":"c87f2b6c-f133-4c6f-9ddb-07c0a1ee6fa1","resolution":{"observed_at":"2026-08-15T21:02:47.634139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.601454Z","title":"Subjective evaluation of speech quality with a crowd- sourcing approach, 2018","venue":null,"work_id":"94b3cf20-d54e-4ddc-9f5a-bd8ded014db1","year":2018},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.628694Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:44243214db16c4eaf2100cc4f5e06823749b0938df832965597abc9b2089decb","observation_id":"71107992-3aec-49a1-a264-a01315bd3f0b","resolution":{"observed_at":"2026-08-15T21:02:47.609343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17332","last_updated":"2025-01-28T22:51:14Z","snapshot_observed_at":"2026-08-17T11:58:04.289316Z","submitted_at":"2025-01-28T22:51:14Z","title":"Compact Neural TTS Voices for Accessibility","version":1},"cited_work":{"arxiv_id":"2501.17332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.17332","snapshot_observed_at":"2026-08-15T21:02:46.606940Z","title":"Compact Neural TTS Voices for Accessibility","venue":"cs.SD","work_id":"47b240cb-c760-46fd-971c-3349102a8dfe","year":2025},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.639186Z"},"links":{"cited_paper":"/paper/2501.17332","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:bf988b2df53f80ea3df407872eb877a17e1202dfba825898341bb2504f45bb06","observation_id":"8918ce2d-48dc-44f8-83a0-fb5157157b10","resolution":{"observed_at":"2026-08-15T21:02:46.619507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.561880Z","title":"Stuck in the mos pit: A critical analysis of mos test methodology in tts evaluation","venue":null,"work_id":"609c0a84-38bb-4375-982e-2fba29a270df","year":2023},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.671587Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:88bff46ce0c607f075413aa11d9d0e65a94aad426e72b3bdd18bbfd97b3a4887","observation_id":"4fe8b601-769d-4554-adff-150867f3c357","resolution":{"observed_at":"2026-08-15T21:02:47.569430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.526905Z","title":"Issues in chinese prosody: conceptual foundations of a linguistically-motivated text-to-speech system for mandarin","venue":null,"work_id":"cfd4a2e4-3c64-4a14-9ac6-31b0756dcf98","year":2002},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.679355Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:d736c409ef908d76a6ea4adc0e64dfafac15558e3d8cfc479775439683ac8691","observation_id":"78dc6c6c-af68-4195-ae55-065e6914a91e","resolution":{"observed_at":"2026-08-15T21:02:47.540103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.487811Z","title":"The limits of the mean opinion score for speech synthesis evaluation","venue":null,"work_id":"4dd290a4-5bf6-4996-8c2c-7c7289322de7","year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.686752Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:b18a78b9ef61df1210c2e43a4b987d4498b841432f8e1487ecf1c674f1611ca3","observation_id":"1ddbb4e4-8785-4c2b-9de7-9bd1c2c331a4","resolution":{"observed_at":"2026-08-15T21:02:47.496958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10058","last_updated":"2024-09-16T07:39:58Z","snapshot_observed_at":"2026-08-17T11:58:22.481726Z","submitted_at":"2024-09-16T07:39:58Z","title":"StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10058","snapshot_observed_at":"2026-08-15T21:02:45.723124Z","title":"Styletts-zs: Efficient high- quality zero-shot text-to-speech synthesis with distilled time-varying style diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.723124Z"},"links":{"cited_paper":"/paper/2409.10058","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:fc44d03e37d6c2c27e6c849bc90d8a78e36a4b626cb0dadf23b91408cd6c99fb","observation_id":"25e06993-00be-4795-9ff1-7e7478a64e9e","resolution":{"observed_at":"2026-08-15T21:02:45.723124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.452148Z","title":"Hyper-realistic, multi-emotion generative speech model speech-01","venue":null,"work_id":"6514db38-294a-4256-873f-f283c24af0fb","year":2025},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.736670Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:50b17e8605a5f6f9ad0dbe290e7f5aa932501c69e0d537ba0ce5578665361bbd","observation_id":"ee85daee-7f91-4448-bb93-d3020af5c143","resolution":{"observed_at":"2026-08-15T21:02:47.462948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04371","last_updated":"2021-04-09T14:04:06Z","snapshot_observed_at":"2026-08-17T11:58:02.470160Z","submitted_at":"2021-04-09T14:04:06Z","title":"Speech Quality Assessment in Crowdsourcing: Comparison Category Rating Method","version":1},"cited_work":{"arxiv_id":"2104.04371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.04371","snapshot_observed_at":"2026-08-15T21:02:46.392484Z","title":"Speech Quality Assessment in Crowdsourcing: Comparison Category Rating Method","venue":"cs.MM","work_id":"742184e1-7711-4de1-b460-cde0da866e1d","year":2021},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.765487Z"},"links":{"cited_paper":"/paper/2104.04371","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:348ecd7bd728a65f28e726982dc70ade3b4211ff89f76aff18ad505c8c3ee9e1","observation_id":"23f73e61-8485-4b1d-b7a4-b63c8ebd9b16","resolution":{"observed_at":"2026-08-15T21:02:46.404802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.418317Z","title":"The blizzard challenge","venue":null,"work_id":"75f968b2-0352-4acc-aadd-eae852cecf1a","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.773130Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:571ac415d28e758dfa88aba26a99a99f1e7ac5ffa20a3025f09944b2b5b5f3b0","observation_id":"653dc60e-7403-48af-a90e-c356fc618f18","resolution":{"observed_at":"2026-08-15T21:02:47.427943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.387257Z","title":"Dnsmos p","venue":null,"work_id":"fbf73d10-4c3d-4602-893b-faa11ec8b5fe","year":2022},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.796723Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:976b6605b8710901118f8e767d7ea0d207e3a815948c9f339d3007f334628b8c","observation_id":"5ecee893-2d36-4eca-a73a-a04941c003c4","resolution":{"observed_at":"2026-08-15T21:02:47.401200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-20T05:06:38.014724Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-15T21:02:45.817444Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.817444Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:bc990604f60536bd7b9e89e2dab8d100bfc0e5c7da07acff2974f3d5a53772e8","observation_id":"a8de6606-9795-4a78-bbc8-7041e0f01c01","resolution":{"observed_at":"2026-08-15T21:02:45.817444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.339027Z","title":"Mean opinion score (mos) revisited: methods and applications, limitations and alternatives","venue":null,"work_id":"6ae95eb0-e2d0-4c20-9f38-b5b889c72055","year":2016},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.827440Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:e9dab0b94b3a907570126c37947feac17d4cd1b591337eaefb83c19bd627fc68","observation_id":"7ec24e69-2d0f-447d-9579-242ec86fb6cf","resolution":{"observed_at":"2026-08-15T21:02:47.357552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12719","last_updated":"2025-05-27T02:40:41Z","snapshot_observed_at":"2026-08-17T11:58:06.615478Z","submitted_at":"2024-11-19T18:37:45Z","title":"Rethinking MUSHRA: Addressing Modern Challenges in Text-to-Speech Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12719","snapshot_observed_at":"2026-08-15T21:02:45.838352Z","title":"Rethinking mushra: Addressing modern challenges in text-to-speech evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.838352Z"},"links":{"cited_paper":"/paper/2411.12719","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:36378b541a165d2dd1840de4246b047ab9b3805cc8829fd29cb108bed0b89399","observation_id":"2d921818-f727-435a-b522-005c737f94ca","resolution":{"observed_at":"2026-08-15T21:02:45.838352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-15T21:02:45.850786Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.850786Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:8518f601cde4c9658f0f3c47260cedbcad214a57ebc707b89f4d7bad5fda15ac","observation_id":"eca95645-6b86-4f9c-8307-7e66d4703efa","resolution":{"observed_at":"2026-08-15T21:02:45.850786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.306085Z","title":"Contextual interactive evaluation of tts models in dialogue systems","venue":null,"work_id":"6dbc2313-d284-4e65-a963-0a9e17d68b83","year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.859506Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:d18ec80e6f244bc842246383b21230feb86e990fb32f024c9db341973d4af38d","observation_id":"ed67bc23-3e89-4bb0-bb63-f9fcfed3ee86","resolution":{"observed_at":"2026-08-15T21:02:47.320286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-20T01:09:59.849605Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-15T21:02:45.866945Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.866945Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:aae424144b0f98f7a176d20a6c736cc42a0b7ca146d5c0949e97df1caf5f0e59","observation_id":"320ec6cd-47ca-4755-b7f4-245507619faa","resolution":{"observed_at":"2026-08-15T21:02:45.866945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.253225Z","title":"Bilingual and code- switching tts enhanced with denoising diffusion model and gan","venue":null,"work_id":"d61395f8-0bfb-407e-9db6-25e555664635","year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.875017Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:b8e3f2e27e7626c392b83ec5c5434ffac6736115f84c4520493fa8ba8b309e36","observation_id":"dfbe0640-77c6-4aff-81a3-0eb3fbfc9e74","resolution":{"observed_at":"2026-08-15T21:02:47.271146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:45.883992Z","title":"Talk2care: An llm-based voice assistant for communication between healthcare providers and older adults","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.883992Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:57a20ab8a40eefc13a337f4bb72db5d185699349a3996a55f8d873d6cfc7ed7e","observation_id":"7d5914c6-f227-43b5-876d-6e43de4d5959","resolution":{"observed_at":"2026-08-15T21:02:45.883992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.220065Z","title":"Dialog modeling in audiobook synthesis","venue":null,"work_id":"06f44574-7356-40d2-af67-c76c80ead9da","year":2024},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.896901Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:578da66ac58bf1b24dc09c80c543a11729662d087b95850cdd7349cd687265c4","observation_id":"0e0df59f-fc67-4124-91d2-ab4338032a0c","resolution":{"observed_at":"2026-08-15T21:02:47.228324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.181107Z","title":"orders of magnitude larger","venue":null,"work_id":"44b353e7-f061-469c-a9b5-7f42ce8d9a20","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.906044Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:2d097c3b9730963a7a2c38538caac8513e76901495f596089b8a9815e556babc","observation_id":"730a5761-7d6e-48b7-b7f6-fc5a6f450973","resolution":{"observed_at":"2026-08-15T21:02:47.196380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.154752Z","title":"Pure machine voice","venue":null,"work_id":"3e5f1911-02b8-4ed9-9587-dbfd0bd44b51","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.913721Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:d2f24d7df86d164dbe27c320ff60fc36de485a2c2249101614dab983159decc1","observation_id":"cdbc3f11-774e-4e02-b821-670445f8fc91","resolution":{"observed_at":"2026-08-15T21:02:47.161308Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.121844Z","title":"The i m i t a t i o n of human speech is too forced","venue":null,"work_id":"695b1c8e-0ba5-4a85-a202-3c7f60eb7001","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.927549Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:a90dc27bcf8016414f1c267d2ddcbc71d44374e3bfa9fdb73eb7c9a7f5095baf","observation_id":"a6cc27a3-e201-445b-8c9d-6e51f2a837f3","resolution":{"observed_at":"2026-08-15T21:02:47.135018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.090580Z","title":"O b v i o u s l y a machine tone - doesn ’ t sound like a real person","venue":null,"work_id":"31bf62ea-4ec4-4673-8e12-c1beabfea6eb","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.934317Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:fdffbe731c13361035e5e7de3ea68191440bb8744dc086470d8173c8a168b677","observation_id":"64a8d3f5-6982-4628-b4c9-dae1e669ed74","resolution":{"observed_at":"2026-08-15T21:02:47.098970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.065498Z","title":"Sounds like a late - night radio host","venue":null,"work_id":"72bb1797-2d7f-4267-afff-c1bcb6cdf387","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.948407Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:64c44c96c29d489c943e876bdbdbef312118e4f6044de60f6733cfabe2cf7759","observation_id":"da151159-e479-4e0f-999d-208f638af4c1","resolution":{"observed_at":"2026-08-15T21:02:47.071983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:47.037396Z","title":"Many thins","venue":null,"work_id":"d0171a2d-73cd-4183-a1c0-75e3057eda8b","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.960734Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:903f07378b8bac46cd6d08260ebbaec4f3ecee71ebb3162fe2656daadf4c63a0","observation_id":"ac974039-4221-4c92-afeb-5000f6d26a52","resolution":{"observed_at":"2026-08-15T21:02:47.047847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:46.979939Z","title":null,"venue":null,"work_id":"501b8bab-5e13-462f-bbe1-949b1f312356","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.971102Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:bf9f66624c3d18307db825c49afc1ad437a85693a02c078641480a4005168f3e","observation_id":"cc2d41db-d096-4f5e-b35b-038e7cb39e49","resolution":{"observed_at":"2026-08-15T21:02:46.992756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:46.942295Z","title":"go away","venue":null,"work_id":"7823ce3c-57a1-4c5d-a828-04285efd9e87","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.978046Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:aab452966e19924948c591a3a68a17ce0c4f678cc7c4950be8167068faaa7edb","observation_id":"69e6cc48-396f-48e5-ae18-3bec302d2417","resolution":{"observed_at":"2026-08-15T21:02:46.948182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:46.911786Z","title":"angry ,","venue":null,"work_id":"1a46bae9-e16d-41a4-aad9-ce05e4391e90","year":null},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.995503Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:a7db84544a446f0516af49326c0109992e1d316e515134148beb9c07f7bd4e77","observation_id":"730e009a-eede-46dd-b78a-3a67896de368","resolution":{"observed_at":"2026-08-15T21:02:46.921239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/blizzard.2023-1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:46.082690Z","title":"doi: 10.21437/Blizzard.2023-1","venue":null,"work_id":"70cc90bb-0c0e-473b-8134-944ae9d750a1","year":2023},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.789007Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:d1dbe62423aab77652692ff3bad6ee09507df02dad3d77301e30550e9f47e08b","observation_id":"45f9dab7-753f-4a68-a415-96c670f0e988","resolution":{"observed_at":"2026-08-15T21:02:46.092266Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:02:45.696157Z","title":"URL https://www.sciencedirect","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese","version":1},"reference_index":2308,"source":"pdf_text","source_observed_at":"2026-08-15T21:02:45.696157Z"},"links":{"citing_paper":"/paper/2505.11200"},"observation_digest":"sha256:08f5efbcca5079d8d1472e7fcf1d299f1a8c8a4daa7ce6e5a84ecce1fdd8ab38","observation_id":"1aed6274-3448-4c8d-afe2-64eb5efbe64b","resolution":{"observed_at":"2026-08-15T21:02:45.696157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11200","last_updated":"2025-05-16T12:57:23Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T07:27:35.295608Z","submitted_at":"2025-05-16T12:57:23Z","title":"Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":17,"verified_exact":4,"verified_fuzzy":26},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2505.11200."}