{"as_of":"2026-08-08T21:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8883871a9db1eb05cc0112a85737ca5109edcdbd6d51daeb75085d10949c09a3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:56.239809Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:49:38.607429Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:4589d6f1b2a36b14e18a86d599b4b19e937956f402751d981018d1344f7c5feb","observation_id":"080ee40c-76b7-47f6-b127-d023a047e778","resolution":{"observed_at":"2026-05-11T19:21:27.038704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-07T14:17:56.239809Z","title":"Aishell-3: A multi- speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.239809Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:06024bcd47e4a2018f10f785e49825e46bcbf7a2428b6726b12f948bd4acb0ea","observation_id":"72b3b378-ef9c-4449-8708-5f8c65c46d46","resolution":{"observed_at":"2026-08-07T14:17:56.239809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-07T05:20:56.536930Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-08T14:12:05.533692Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.536930Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:a7e0077bcada0a14e33b30d98b280878243f380b4fee9aaef3ef4db0fc3c1b58","observation_id":"b1404a95-a522-4169-adbf-291624ac1cc5","resolution":{"observed_at":"2026-08-07T05:20:56.536930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-06T12:49:21.272793Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-08-07T23:23:35.413701Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T12:49:21.272793Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2507.21463"},"observation_digest":"sha256:cf83313c979bcdd99b55355508b4d763b42be77424c8dfdc2ee127ede2c54207","observation_id":"a99b368e-9179-465a-ada5-1305950229a7","resolution":{"observed_at":"2026-08-06T12:49:21.272793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-05T22:07:46.302600Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.07558","last_updated":"2025-08-11T02:35:54Z","snapshot_observed_at":"2026-08-08T11:57:57.874638Z","submitted_at":"2025-08-11T02:35:54Z","title":"UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T22:07:46.302600Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2508.07558"},"observation_digest":"sha256:1528f233115cd2362421581951823e8a867fc5520933eb6996ee8f9392131e84","observation_id":"ae9dbea3-a6f2-40af-abba-98735084747f","resolution":{"observed_at":"2026-08-05T22:07:46.302600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-05T16:31:05.595288Z","title":"Biaobei dataset","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.18440","last_updated":"2025-08-25T19:39:20Z","snapshot_observed_at":"2026-08-06T18:06:31.486920Z","submitted_at":"2025-08-25T19:39:20Z","title":"SwiftF0: Fast and Accurate Monophonic Pitch Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:31:05.595288Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2508.18440"},"observation_digest":"sha256:971d4b082c97802b172a5a727bbbb2cb5d93bcface134841bf8f0d539297943e","observation_id":"9145723c-61f8-4897-9a5c-95f581107e06","resolution":{"observed_at":"2026-08-05T16:31:05.595288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-04T19:37:53.149135Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.149135Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:446fde46aea3c4533d668e0f509286925d5ff3f9b32bdae8caf237d9d40efb58","observation_id":"3fe8a6d4-6c3c-4f6e-a61e-b88ac4cb3a0d","resolution":{"observed_at":"2026-08-04T19:37:53.149135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2509.19883","last_updated":"2026-04-11T06:12:16Z","snapshot_observed_at":"2026-08-02T07:43:41.108992Z","submitted_at":"2025-09-24T08:34:19Z","title":"CoMelSinger: Discrete Token-Based Zero-Shot Singing Synthesis With Structured Melody Control and Guidance","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T14:34:15.220263Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2509.19883"},"observation_digest":"sha256:73ca4056383e08fddb7ba7cd4ec784b9cce94e9215037010439c9d57548423ea","observation_id":"ede1d017-df78-4cc2-bed4-1c84314f5094","resolution":{"observed_at":"2026-05-18T14:36:28.785216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-04T09:12:59.187097Z","title":"Aishell- 3: A multi-speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2510.16834","last_updated":"2026-07-22T04:00:42Z","snapshot_observed_at":"2026-08-07T17:20:03.087506Z","submitted_at":"2025-10-19T13:46:13Z","title":"Schr\\\"odinger Bridge Mamba for One-Step Speech Enhancement","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T09:12:59.187097Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2510.16834"},"observation_digest":"sha256:a03bb399c5d5db8ceac15636bcf34c60922d6c74456c16d59d1d3f6242717837","observation_id":"59b7d247-258c-4e58-81c3-665acdc0a55f","resolution":{"observed_at":"2026-08-04T09:12:59.187097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2512.20211","last_updated":"2026-06-29T06:29:50Z","snapshot_observed_at":"2026-08-08T01:39:31.067018Z","submitted_at":"2025-12-23T10:04:48Z","title":"Aliasing-Free Neural Audio Synthesis","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T20:34:50.539351Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2512.20211"},"observation_digest":"sha256:130989ca63768b908c289ad4c371b011d08f3f5989d99612db9472db42af96b4","observation_id":"e9434d92-ebe4-4f3f-b63e-32a431447960","resolution":{"observed_at":"2026-05-16T20:38:24.807719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-03T14:33:13.615847Z","title":"AISHELL- 3: A Multi-speaker Mandarin TTS Corpus and the Baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2512.20211","last_updated":"2026-06-29T06:29:50Z","snapshot_observed_at":"2026-08-08T01:39:31.067018Z","submitted_at":"2025-12-23T10:04:48Z","title":"Aliasing-Free Neural Audio Synthesis","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T14:33:13.615847Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2512.20211"},"observation_digest":"sha256:c2ff5986e0fa8c7297725ab770d854bcb5df9e6fad164b887403a683fc20b53f","observation_id":"660a81a9-150a-4a4f-85c3-0cc6b8fda1c1","resolution":{"observed_at":"2026-08-03T14:33:13.615847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2601.04638","last_updated":"2026-04-18T12:24:30Z","snapshot_observed_at":"2026-08-07T21:01:38.315526Z","submitted_at":"2026-01-08T06:14:58Z","title":"SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T17:00:59.421441Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2601.04638"},"observation_digest":"sha256:d44c0859fa23bcda87a41dc2a231e3798802faa546f35d417cb00d53c9d276e2","observation_id":"382d7016-5903-49f6-8b9b-bb98d1d4fa4f","resolution":{"observed_at":"2026-05-16T17:01:07.558745Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2604.08184","last_updated":"2026-04-09T12:38:19Z","snapshot_observed_at":"2026-08-02T08:09:42.022596Z","submitted_at":"2026-04-09T12:38:19Z","title":"AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T17:40:10.657590Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2604.08184"},"observation_digest":"sha256:d3ab8485a9058f1cac56527b92cd418989eacea308248134768d2081860c091e","observation_id":"99101ee1-bdd1-40b3-8aad-c3249b48d02b","resolution":{"observed_at":"2026-05-11T06:21:00.656870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:38870c6c8089442bc82f681751579810b0bd9ce7d9ad65013a10acb6d0f0e022","observation_id":"d9f90c94-f0b9-4589-90ee-a3386cf88e91","resolution":{"observed_at":"2026-05-11T08:30:57.000225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-08T18:16:48.532228Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:b3eba180ed54a339104f245a57a2a5daa476eba82e8bca6f9836698b8755bda2","observation_id":"5c0903ec-2150-4288-8a05-51b1f7ae5c0f","resolution":{"observed_at":"2026-05-11T04:50:55.944674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2605.11098","last_updated":"2026-05-11T18:04:33Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T18:04:33Z","title":"AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T01:04:54.506749Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2605.11098"},"observation_digest":"sha256:a1b42f0d268872a985b590410c3bf29501a4440a70e4799de749b6b0f0eb4592","observation_id":"9e17326b-787e-4924-a8f8-91a541982b3e","resolution":{"observed_at":"2026-05-13T01:07:00.259741Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-02T05:33:25.305210Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:db7f216055be7519189e9d4b9ae08c40b9e7d09c1fdb1d2903421bfbbadabb1a","observation_id":"1436a86b-d04e-4db9-a1a8-371b85b70769","resolution":{"observed_at":"2026-07-02T01:06:23.940166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2606.04418","last_updated":"2026-06-03T03:56:14Z","snapshot_observed_at":"2026-08-08T16:37:18.033286Z","submitted_at":"2026-06-03T03:56:14Z","title":"CleanCodec: Efficient and Robust Speech Tokenization via Perceptually Guided Encoding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T05:20:49.952030Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2606.04418"},"observation_digest":"sha256:5894a13a3d557cce4c09c587979b5513899fab7a08537cd47564b9767591b163","observation_id":"69a15ad5-1818-4586-ad04-70fbff2f53cc","resolution":{"observed_at":"2026-07-02T09:56:51.761438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2606.10591","last_updated":"2026-06-09T08:55:47Z","snapshot_observed_at":"2026-08-06T05:44:02.287372Z","submitted_at":"2026-06-09T08:55:47Z","title":"ContextCodec: Content-Focused Context Guidance for Ultra-Low Bitrate Speech Coding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T11:51:25.305324Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2606.10591"},"observation_digest":"sha256:79c169a6e534d3945551ce15d98e6c12b5a0ce52c7da7cae59df4db9003ac54e","observation_id":"b89d8ed0-6b2e-4c88-b7bd-05fd353eac66","resolution":{"observed_at":"2026-07-03T07:47:44.574399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2606.11631","last_updated":"2026-06-10T03:49:54Z","snapshot_observed_at":"2026-08-02T17:57:49.398213Z","submitted_at":"2026-06-10T03:49:54Z","title":"Benchmarking Neural Speech Compression from a Rate-Distortion Perspective","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-27T08:43:35.279033Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2606.11631"},"observation_digest":"sha256:a0098cd60fa17ecc719c9a035c4386899d6fa983ccc22ba4a95025accf6b96d7","observation_id":"2e069813-4b96-4c0a-957a-6beeb27708c7","resolution":{"observed_at":"2026-07-03T12:48:12.259675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2606.11681","last_updated":"2026-06-11T05:16:07Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T05:51:20Z","title":"UR-BERT: Scaling Text Encoders for Massively Multilingual TTS Through Universal Romanization and Speech Token Prediction","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T10:07:31.795522Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2606.11681"},"observation_digest":"sha256:fad408bcc1055c3164d8c00ba4bb2299a289489c7817e412f0ce503d2a90caa7","observation_id":"d58346c9-cf64-4b04-90ef-49a30faf9bf1","resolution":{"observed_at":"2026-07-03T10:17:57.751682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":"2010.11567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-04T07:49:38.607429Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":"56ec7c2f-2845-4626-80a8-7399c98291f3","year":2020},"citing_paper":{"arxiv_id":"2606.21457","last_updated":"2026-06-19T14:13:16Z","snapshot_observed_at":"2026-08-06T06:15:47.322351Z","submitted_at":"2026-06-19T14:13:16Z","title":"DisSpeech: Low-Resource Controllable Mandarin Stuttered Speech Synthesis for ASR Augmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T12:53:34.428544Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2606.21457"},"observation_digest":"sha256:3912304d1e90156fce7fdab8f35cd22dba5bffe5915846126e9509ab8e80f6ac","observation_id":"a949a7e9-5d13-464e-a3a1-a3f94fe8517f","resolution":{"observed_at":"2026-07-04T07:49:38.609190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-07-31T10:28:23.043310Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-07-30T15:21:38Z","snapshot_observed_at":"2026-08-08T20:24:07.187604Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.043310Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:5da5ad9ad9ea167a47113702818ed63359cf7b17504ba1647d1b00682b5d11e3","observation_id":"7f9b7f3b-fe35-4c58-8aef-be0e603c8e3f","resolution":{"observed_at":"2026-07-31T10:28:23.043310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-04T16:29:27.881861Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:27.881861Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:b0d51cec3a3f5fbe160c3c5d63a50edf1a62f78e6249ca6a8996cdde88abf612","observation_id":"38a312d5-8ddd-48a6-901d-e15527f0d233","resolution":{"observed_at":"2026-08-04T16:29:27.881861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-07T00:14:47.871653Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:47.871653Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:f28a1618ab722ee263fe1a225262d8510df6bbe03e7b54bd06c6d8e4bffa3519","observation_id":"a95b1244-7755-434f-a7bb-b75e33b5c60f","resolution":{"observed_at":"2026-08-07T00:14:47.871653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2010.11567/citation-record","integrity":"/paper/2010.11567/integrity","json":"/paper/2010.11567/citation-record.json","paper":"/paper/2010.11567"},"outbound":[],"paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2010.11567."}