{"as_of":"2026-08-14T20:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd89f041eb401e81309b1e283d4a213c17510bdbef58005937600fc1ca4a4911","coverage":[{"denominator":150,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:21:56.940453Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:26:19.327889Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T11:45:47.119925Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15442","snapshot_observed_at":"2026-08-08T13:26:19.327889Z","title":"Overview of the amphion toolkit (v0.2)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-12T12:30:42.029400Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.327889Z"},"links":{"cited_paper":"/paper/2501.15442","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:ccb2a83707cd08365a739f2bf9c70a6ba40f2c22e117263d0ef8a8c827e9e1dd","observation_id":"d4d9660f-dee0-4fd3-836c-94376ab66820","resolution":{"observed_at":"2026-08-08T13:26:19.327889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15442","snapshot_observed_at":"2026-08-07T11:50:04.356814Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01322","last_updated":"2025-06-02T05:07:06Z","snapshot_observed_at":"2026-08-14T02:14:31.557227Z","submitted_at":"2025-06-02T05:07:06Z","title":"Zero-Shot Text-to-Speech for Vietnamese","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:50:04.356814Z"},"links":{"cited_paper":"/paper/2501.15442","citing_paper":"/paper/2506.01322"},"observation_digest":"sha256:3d4a307ded49c88f43c1e41f45b58a36a1038dd343801c160a81b264d15ff5d0","observation_id":"8598f5e2-524d-4196-afb4-8750e7a734b9","resolution":{"observed_at":"2026-08-07T11:50:04.356814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"cited_work":{"arxiv_id":"2501.15442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15442","snapshot_observed_at":"2026-07-01T11:45:47.119925Z","title":"2) , author=","venue":null,"work_id":"135ead0f-d4f0-4692-b73f-14c2570fc55f","year":null},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2501.15442","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:3ccc6b2808a43cee9615ff1ed3d107264c78243c12127b464baf2f45ad2ccf93","observation_id":"57e53a4d-8694-414f-81ca-a15a61e36d7c","resolution":{"observed_at":"2026-07-01T11:45:47.122493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15442","snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Overview of the amphion toolkit (v0.2),","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-13T10:25:36.187628Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"cited_paper":"/paper/2501.15442","citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:32a06127ba5ebde77d7a07162f6fe56b330651cb953063611dc89c8454414fd5","observation_id":"81f71f1e-67c0-4bba-a587-c6a478490971","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15442/citation-record","integrity":"/paper/2501.15442/integrity","json":"/paper/2501.15442/citation-record.json","paper":"/paper/2501.15442"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T14:21:56.664753Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.664753Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:2ac1f38ce998f02e248fb23c2964b4870923dec2482cc0edface623fd364bdce","observation_id":"9fb8894c-94b5-4523-a1a4-14a7563ad28b","resolution":{"observed_at":"2026-08-10T14:21:56.664753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.669353Z","title":"Powerset Multi-class Cross Entropy Loss for Neural Speaker Diarization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.669353Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:457cf09ca1e4b68323beeb917586a33ea656968049487be373b34f5ea0b000a3","observation_id":"9233c72d-7318-445b-bbe7-98b22bc823a2","resolution":{"observed_at":"2026-08-10T14:21:56.669353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-10T14:21:56.672064Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.672064Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:1192bd122a9c57bf25cb8a49cbc25cad5c6bee14588e72952e1fe48a7ddb3749","observation_id":"6e954cec-5b6b-4a73-95fd-468bc96c2cb1","resolution":{"observed_at":"2026-08-10T14:21:56.672064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.676180Z","title":"Sd-eval: A benchmark dataset for spoken dialogue understand- ing beyond words","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.676180Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:df602b7698eaa5d82ce048b1e91751f8980792167323d2c80264a3a1694ff93c","observation_id":"032b69dd-de93-4a3c-b326-18a55af66f2f","resolution":{"observed_at":"2026-08-10T14:21:56.676180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-10T14:21:56.679058Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.679058Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:78be0877a744c784ba7d1116c94e2840832511342a1e1c9faae14eaa6202d0f9","observation_id":"f20de216-c0fa-4ae2-9415-b9ade29e7593","resolution":{"observed_at":"2026-08-10T14:21:56.679058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.682705Z","title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.682705Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:d7ac5ddb03fc86c7e7edf5306683d564edb389e326a4e3b53442e2d4e0537ce3","observation_id":"1136f15b-1eb4-43a5-9430-4b4e1ecbcb12","resolution":{"observed_at":"2026-08-10T14:21:56.682705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.686284Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.686284Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:6ee9a94313b9c90c85b92989fd69d94c5f755a8a5e707e99861a3c4ee694c035","observation_id":"688d8dcb-6d35-44b8-8bb4-1aedb81c7778","resolution":{"observed_at":"2026-08-10T14:21:56.686284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-14T20:07:53.724755Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-10T14:21:56.688812Z","title":"Soundstorm: Efficient parallel audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.688812Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:9dac7fcf9456ce987eb74e3c918b3d42be8790a6109c60ff1a2dc6240ba1e8a2","observation_id":"5661bae0-aca0-45ef-952a-39ebd08de0fa","resolution":{"observed_at":"2026-08-10T14:21:56.688812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.691517Z","title":"AudioLM: A Language Modeling Approach to Audio Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.691517Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:89e4e53f7bedfeff7e247141cef95d3885ec4baf8fba9e4385969febbe03b90d","observation_id":"f5e20aa3-9ce1-40da-9fdf-3916d0d7fb11","resolution":{"observed_at":"2026-08-10T14:21:56.691517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.694127Z","title":"Data augmentation and loss normalization for deep noise suppression","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.694127Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:faf56c0ae6a60e9ac661f3a56875bb2d61e4ca291417e462ef55936a36c23b3d","observation_id":"26be6c64-0534-4b4b-a87e-3cb69bf44c24","resolution":{"observed_at":"2026-08-10T14:21:56.694127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.697092Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.697092Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:0028657b61ed99671f058205d3dec68f3fc0b8066f4b69b84e94841503795378","observation_id":"ce52798e-64eb-4523-8620-78f139ec9098","resolution":{"observed_at":"2026-08-10T14:21:56.697092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.699996Z","title":"Maskgit: Masked generative image transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.699996Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:3d8051c771ad3c5d0e47687ff55890b32e587c335a2ce64083ff3f9841538069","observation_id":"1be097d8-abe8-47d7-a462-1244fe0e9379","resolution":{"observed_at":"2026-08-10T14:21:56.699996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.702701Z","title":"Gigaspeech: An evolving, multi-domain ASR corpus with 10, 000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.702701Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:4f3a49ca233e5912d38207a6dbdc1cd8716b3a757b491e53ed350698dfd649a4","observation_id":"8abaa3f6-38f5-4bd5-bcd8-ea540c1fb82d","resolution":{"observed_at":"2026-08-10T14:21:56.702701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.705348Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.705348Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:cac0fc115b0df52b4f04f5d78733d4c709d4889ddc36ef5134cf71c517856883","observation_id":"4a63c61f-543a-49c8-a523-d3a49e22b287","resolution":{"observed_at":"2026-08-10T14:21:56.705348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-10T14:21:56.708233Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.708233Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:b8975c0b7fe268b4709e6a90201a2767a76b0faa3525a0d1c4f19f35449f0150","observation_id":"25d91c24-3010-4728-88c7-82ed1d181b0c","resolution":{"observed_at":"2026-08-10T14:21:56.708233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-10T14:21:56.711506Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.711506Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:20165129d6f2909e3f8a1b1167e9e5670a4e294e55aec63cfec284943b237f7b","observation_id":"0d4fddf2-f978-4b66-9acb-64778e5b95f1","resolution":{"observed_at":"2026-08-10T14:21:56.711506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.714682Z","title":"Simple and controllable music generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.714682Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:848dc9af21bc711dbb0fa8d3c051ee5b3a5707f5f8bfdcdd4d700e5b6f5fc25f","observation_id":"0e3ebb6d-94a5-48f9-bbc1-35b26dbb6386","resolution":{"observed_at":"2026-08-10T14:21:56.714682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.717556Z","title":"Librimix: An open-source dataset for generalizable speech separation, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.717556Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:0cd6bad7daf2dc498074c74ba87367f274dacf0bcdaaa86202b74ee8c631dc8a","observation_id":"e4909080-fe5a-4c88-aa4c-a781a86325a4","resolution":{"observed_at":"2026-08-10T14:21:56.717556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.720088Z","title":"Overview of the 2023 icassp sp clarity challenge: Speech enhancement for hearing aids","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.720088Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:63f7e588534b5e38848dc4213a3d03b8d8a13f6fd40a15ae8f78758e866827b2","observation_id":"18a403e8-054d-4017-9905-cca3b1f37f8c","resolution":{"observed_at":"2026-08-10T14:21:56.720088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-10T14:21:56.722997Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.722997Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:287594f8fee10df0e9d6644708acf22d0f20868ecebafdb6de279006294d840b","observation_id":"fe5c9afc-8d95-457f-b74f-a82f72f7f2cb","resolution":{"observed_at":"2026-08-10T14:21:56.722997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.726307Z","title":"Real time speech enhancement in the waveform domain","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.726307Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:fc7f76dd07d3063f714e35c6e666434b7a289db85375bbfa0803df1941c8560a","observation_id":"65ccbcd5-bc1d-4004-a135-99fa31108b3b","resolution":{"observed_at":"2026-08-10T14:21:56.726307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.728929Z","title":"The ncte transcripts: A dataset of elementary math classroom transcripts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.728929Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:9c4d09ed0f7cf3146a8deaf70d35372ce8ed0b713ff10951293e1a360a1f0a15","observation_id":"0f3c0e4f-b8e6-4c5d-ada2-41b889e16743","resolution":{"observed_at":"2026-08-10T14:21:56.728929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.731481Z","title":"Pengi: An audio language model for audio tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.731481Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:4e3d1f033f1b2899efd41eceed2b74fe791beab808e1652d60ad66c144ee9445","observation_id":"7269c64f-6c19-4c72-9841-efe3467e1a05","resolution":{"observed_at":"2026-08-10T14:21:56.731481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.734023Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.734023Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:dc788d036d0a95f671e572f2d7337cb2bbc10d16e3b42fc73177002f0775a356","observation_id":"f2b59e0b-f70f-4619-b884-a011376618fd","resolution":{"observed_at":"2026-08-10T14:21:56.734023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.736555Z","title":"Exploring speech enhancement with generative adversarial networks for robust speech recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.736555Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:d6f009572c077bfe516a533a4c252994eb92bd6ac0572bde194855c651b91e0f","observation_id":"e92f1155-03a1-4184-a47e-7bf04eac8021","resolution":{"observed_at":"2026-08-10T14:21:56.736555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.739122Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.739122Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:0c3a80777733266be79a5c759d010582a3f7bd65901bbc6dee5eeb61e39b83b3","observation_id":"d7cbc66a-d73e-4557-a2a3-08c99735048a","resolution":{"observed_at":"2026-08-10T14:21:56.739122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-10T14:21:56.741411Z","title":"Défossez, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.741411Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:70a6a132247d6ef5e5b9676189d4c9f3f3fa35ba76fa08d52c07be15bba9e9b8","observation_id":"a814e7ce-67c7-4743-bf9c-e206f38bb230","resolution":{"observed_at":"2026-08-10T14:21:56.741411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.743913Z","title":"Introduction to audio data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.743913Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:89ca8aaba0d104bd7f20389429d9fc86fe0dc513954dbc6b2ce5783d9d4a7f87","observation_id":"cf10d203-f963-45d5-a399-8fdafed36048","resolution":{"observed_at":"2026-08-10T14:21:56.743913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.746599Z","title":"Super-scotus: A multi- sourced dataset for the supreme court of the us","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.746599Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:540180aa93b4febddc9b215cead25c5a58c72bc66a346c08aac0efc699317d0d","observation_id":"8e87a630-419f-452a-9a12-fb6acc2db29f","resolution":{"observed_at":"2026-08-10T14:21:56.746599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-12T22:47:34.452271Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-10T14:21:56.749133Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.749133Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:b1221522cf4d37804ea09c112e594ebdc33297dfeed69e0c1f418d473035b918","observation_id":"2b0625f8-1a5c-4afe-88c1-573aebba36b8","resolution":{"observed_at":"2026-08-10T14:21:56.749133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-10T14:21:56.752505Z","title":"Text-to- audio generation using instruction-tuned llm and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.752505Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:93b766e27fa06306d51d86e02f0ae18cb7d8a54db651345d32bf32eeebd8e249","observation_id":"f7d37e2e-d5cb-4911-88fd-5825de27fe83","resolution":{"observed_at":"2026-08-10T14:21:56.752505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.755993Z","title":"Liu, Leonid Karlinsky, and James R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.755993Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:0d69b82dde7dd06d51a949e3462f1fe61ec3f5e0e622012ed18881abd26364b0","observation_id":"61454f8a-6c84-4c56-9390-336464a314b1","resolution":{"observed_at":"2026-08-10T14:21:56.755993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.758548Z","title":"Multi-scale sub-band constant-q transform discriminator for high-fidelity vocoder","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.758548Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:2e89bb2f90ffb69a503b52c61fc5d8aa15de09a7bb2d0147725e6ceab2ffecee","observation_id":"f7f833b2-cd6c-4116-a82e-8d36dfa621e4","resolution":{"observed_at":"2026-08-10T14:21:56.758548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.761260Z","title":"Conformer: Convolution- augmented transformer for speech recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.761260Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:66589b4453eebcecc057d357edc9dbe670445fec3868993b409498c6f974122c","observation_id":"31794911-d5a6-49c4-9034-5a5b781d7844","resolution":{"observed_at":"2026-08-10T14:21:56.761260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-14T01:59:59.515548Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-10T14:21:56.764205Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.764205Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:42638e9f34c89e5a2dcfb63d075d56f9d926f1cf7e2f2e64c285cf35cffc6afa","observation_id":"405f8fce-1278-4214-b2b5-4009a4c5dfde","resolution":{"observed_at":"2026-08-10T14:21:56.764205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.767466Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.767466Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:eb5542ba89b99d0cfe75396c1e7f3fbe01318370f8e36e52eb3b6d55fb57e9f5","observation_id":"c48b55f6-9957-4b36-b49d-8c15668fad55","resolution":{"observed_at":"2026-08-10T14:21:56.767466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19770","last_updated":"2025-08-28T13:12:13Z","snapshot_observed_at":"2026-08-12T05:47:34.983835Z","submitted_at":"2024-11-29T15:18:01Z","title":"Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19770","snapshot_observed_at":"2026-08-10T14:21:56.770180Z","title":"Noro: A noise-robust one-shot voice conversion system with hidden speaker representation capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.770180Z"},"links":{"cited_paper":"/paper/2411.19770","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:245ddc662bc4f53f614241a75f72ea4a075903f9dcd79785e4e31fe3a0db8fdd","observation_id":"3570b13a-c15e-46ec-af69-4eae64aaa75c","resolution":{"observed_at":"2026-08-10T14:21:56.770180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-10T14:21:56.773121Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.773121Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:0d053b9a9db1dc8732476ffafc1a6129df0ab0b5028d5656c77a4d4e16c5b568","observation_id":"bd7ea5f8-283f-4c19-9d8b-b92432394cba","resolution":{"observed_at":"2026-08-10T14:21:56.773121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.776184Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.776184Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:9940214189ce6e22a1159e6579a85b579d5d42093c892521213b540a7dac2f0b","observation_id":"d08adf07-3e93-4824-802d-47f53c0c4102","resolution":{"observed_at":"2026-08-10T14:21:56.776184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.778941Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.778941Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:368f68d9b82c5b88500c6c46bf456bb448705b1657ef0c792be21c26a8e93ba9","observation_id":"97633959-b0ba-49be-a899-40fa4a94d72e","resolution":{"observed_at":"2026-08-10T14:21:56.778941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-14T14:21:19.619182Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-10T14:21:56.781684Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.781684Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:3caa8bb08a434b866c2232576dcd658ef7b90851f7822d655f2184d93559fa64","observation_id":"46b82778-5d37-4368-9455-c69442a9b454","resolution":{"observed_at":"2026-08-10T14:21:56.781684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.784989Z","title":"The singing voice conversion challenge 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.784989Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:b4ca0592e5012583aad4199c74073cec5d00f6c44266487caf6fe10dd3ef06dc","observation_id":"5dc29f4e-4bf9-4c3a-9ca8-87c654f2be6b","resolution":{"observed_at":"2026-08-10T14:21:56.784989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.787173Z","title":"Debatts: Zero-shot debating text-to-speech synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.787173Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:4895b97759073408a25355dea7d8c64b5682f6c8b51d970a474dd646f1672059","observation_id":"7bd97b3b-1cbb-42f1-be7f-75c68711ab92","resolution":{"observed_at":"2026-08-10T14:21:56.787173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.789486Z","title":"Repcodec: A speech representation codec for speech tokenization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.789486Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:7c314c1a89efde06d14e2d4872d22b1eb3b37717f25fa4fdeef8a8fbec1ba261","observation_id":"23025484-369e-46e7-adcf-e8480f20a8a6","resolution":{"observed_at":"2026-08-10T14:21:56.789486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.791767Z","title":"The lj speech dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.791767Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:d606734bb8ba929aad1cc0a6ab55e2347ecba2f4638d3e1d3e637f5354368bd7","observation_id":"4517ac67-2e6b-4774-bab2-2db7892ac8a5","resolution":{"observed_at":"2026-08-10T14:21:56.791767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.794848Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.794848Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:a071681381773acfdd89bdd4d06abcd6ad8e564ef2f0ae9f7e53028a84280d0c","observation_id":"e7438ec5-f919-4fca-b9e2-c60e45301ba5","resolution":{"observed_at":"2026-08-10T14:21:56.794848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.798397Z","title":"AASIST: Audio Anti-Spoofing Using Integrated Spectro- Temporal Graph Attention Networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.798397Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:664ba257719aa5eac2ebdeed6e2b23ed7a84a58168e25c2170be2b449329f2df","observation_id":"815bf137-36a6-411e-9f2d-bb98746a11de","resolution":{"observed_at":"2026-08-10T14:21:56.798397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.800834Z","title":"Libri-light: A benchmark for ASR with limited or no supervision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.800834Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:0d0ce931766acd20e2721974abad042c2d1ba6c8e55757f5401ac7ded71eac4d","observation_id":"be519a90-6c3f-4f22-9f83-28eafb974ad8","resolution":{"observed_at":"2026-08-10T14:21:56.800834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.804065Z","title":"Librivox: Free public domain audiobooks","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.804065Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:d74288c70ecf9e05b56d75a3d6053f57b1e1c02e94abc82e419302670bcaad4b","observation_id":"d92074a6-22a3-4d9a-9706-27ef687f3323","resolution":{"observed_at":"2026-08-10T14:21:56.804065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.807463Z","title":"Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.807463Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:aefad0da52a4b289bee8b4cc64353043833b8b5fa83d400635d8586cd8016717","observation_id":"586b9c88-8913-45f8-9926-b97032ee208d","resolution":{"observed_at":"2026-08-10T14:21:56.807463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.810249Z","title":"Hifi-gan: generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.810249Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:f76ddcee5121ac19df6c860ea156ad62d31d671695437d3195a36135c3b253b1","observation_id":"5050ad88-c8e4-492b-a097-9bbdc02eaeff","resolution":{"observed_at":"2026-08-10T14:21:56.810249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-13T04:28:07.254735Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-10T14:21:56.812438Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.812438Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:04036f9c323b55f3a0631b0002a369322aee83bc55a3ea24bceb7d6f36c01f69","observation_id":"9c6468c7-728e-40b7-bb9a-3b787f908e8c","resolution":{"observed_at":"2026-08-10T14:21:56.812438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.815009Z","title":"AudioGen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.815009Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:3b0feacb15f928eb5edb2e7ec6fb58ab97a24a943fb041e03ef50bc7c1ff862a","observation_id":"2d2025e7-fcab-4402-a6a6-d24f779c06d3","resolution":{"observed_at":"2026-08-10T14:21:56.815009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.817661Z","title":"Kumar, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.817661Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:f3bde8998c76cf83f6b4886ec9a92d77de9647317502a4ec90f21b8b58691b31","observation_id":"698abf5a-afbd-43c5-9f7b-940df9565bd3","resolution":{"observed_at":"2026-08-10T14:21:56.817661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.819883Z","title":"V oiceBox: Text-guided Multilingual Universal Speech Generation at Scale.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.819883Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:eaf05bc26eeaeb561d364a0870b89763b40e5dede1384ed11d4ada95b235b325","observation_id":"ae1fe7df-c22c-4a55-bb19-11d2ebc267b4","resolution":{"observed_at":"2026-08-10T14:21:56.819883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.822149Z","title":"Textless speech-to-speech translation on real data","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.822149Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:4d6559468caa823120d2f6bbef656e59daa8031beb065d714d7d1e58dadaef47","observation_id":"c80c56d8-2980-4eb1-9bb4-9f80f190ab9f","resolution":{"observed_at":"2026-08-10T14:21:56.822149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.824471Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.824471Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:30cbfaecdb3babd57c2a18b56ac063c5e60fd41853218620f4dd4237f5dc712e","observation_id":"112cb62f-e905-4a89-9c1e-53f76967c6c1","resolution":{"observed_at":"2026-08-10T14:21:56.824471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12454","last_updated":"2023-11-27T12:26:32Z","snapshot_observed_at":"2026-08-13T17:35:46.025393Z","submitted_at":"2023-11-21T09:07:11Z","title":"HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12454","snapshot_observed_at":"2026-08-10T14:21:56.827008Z","title":"Hierspeech++: Bridging the gap between semantic and acoustic representation of speech by hierarchical variational inference for zero-shot speech synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.827008Z"},"links":{"cited_paper":"/paper/2311.12454","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:0a51a44f21ff48a280cf5584dec7aeda06d1a5d8fd9d7d4855aec44fb8e9074f","observation_id":"4c73151f-6e9f-4e2d-b653-dddd8d5697c6","resolution":{"observed_at":"2026-08-10T14:21:56.827008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.829455Z","title":"Storm: A diffusion- based stochastic regeneration model for speech enhancement and dereverberation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.829455Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:b81917a7e1a8f856862f78ac13fdc1eb403c9dcfc997b48ee566d9838d303bef","observation_id":"dd943c17-751e-4947-9d43-29e526936860","resolution":{"observed_at":"2026-08-10T14:21:56.829455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.832581Z","title":"Improved masked image generation with token-critic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.832581Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:afce1599d299a560d3ebfb310460ddc9c552cbf170cf4216d77dad0db43c368f","observation_id":"38a957ad-aa67-4582-aca1-9154e7447fb9","resolution":{"observed_at":"2026-08-10T14:21:56.832581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.835894Z","title":"Espnet- se: End-to-end speech enhancement and separation toolkit designed for asr integration","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.835894Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:eb448d3e1d9e77140ccaa0401abf88b472d6256fdf36451a39e7347539d3f3e1","observation_id":"553ae97f-bfde-4c59-b35b-235c2a236f57","resolution":{"observed_at":"2026-08-10T14:21:56.835894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.838266Z","title":"Investigating neural audio codecs for speech language model-based speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.838266Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:ecde0e6ddaddbfb3b13bde6d545b2bf79fe0caecf140478886d68c1b46a6448f","observation_id":"106a6a93-dd3d-4b49-9ea0-2849d55d6a87","resolution":{"observed_at":"2026-08-10T14:21:56.838266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02092","last_updated":"2024-06-04T08:23:57Z","snapshot_observed_at":"2026-08-13T12:51:32.916321Z","submitted_at":"2024-06-04T08:23:57Z","title":"MaskSR: Masked Language Model for Full-band Speech Restoration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02092","snapshot_observed_at":"2026-08-10T14:21:56.840664Z","title":"Masksr: Masked language model for full-band speech restoration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.840664Z"},"links":{"cited_paper":"/paper/2406.02092","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:926dfdc9857760293750a1395e2d99a70ff9066fc2f3abfc95e5895d76471225","observation_id":"928c8276-4e12-4f2d-953c-4abfb09d1e62","resolution":{"observed_at":"2026-08-10T14:21:56.840664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.843675Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.843675Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:904c3deb5c58db52a2b65c641bc314138ea184731a0dd5ff19f0871f7e5b5f9b","observation_id":"629dac48-25a1-4db7-895a-0165dad5fdb5","resolution":{"observed_at":"2026-08-10T14:21:56.843675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.846090Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.846090Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:f8c8933ae5b9321d2cfd9c384b5e746bdb0126d13bce7e014a372b5af30000a1","observation_id":"8d7fe1ae-b39e-425d-b731-a4159e6ff9dc","resolution":{"observed_at":"2026-08-10T14:21:56.846090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.848535Z","title":"Audiosr: Versatile audio super-resolution at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.848535Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:e8042f899ed0ac284473e0209b7ffc59baa972ab7beed7a89aea61c046f49529","observation_id":"5614432e-54a3-47cb-b24b-806c370c10a0","resolution":{"observed_at":"2026-08-10T14:21:56.848535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.850991Z","title":"Mandic, Wenwu Wang, and Mark D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.850991Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:49dce936f49858cc3e53aa3af84532cf1377f9861a9d62e3ac0018249c0e3fff","observation_id":"ad2e3afc-6fa0-46f3-af86-0d2235bcf956","resolution":{"observed_at":"2026-08-10T14:21:56.850991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05841","last_updated":"2022-04-17T10:08:38Z","snapshot_observed_at":"2026-08-13T16:03:38.285331Z","submitted_at":"2022-04-12T14:37:39Z","title":"VoiceFixer: A Unified Framework for High-Fidelity Speech Restoration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05841","snapshot_observed_at":"2026-08-10T14:21:56.853600Z","title":"V oicefixer: A unified framework for high-fidelity speech restoration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.853600Z"},"links":{"cited_paper":"/paper/2204.05841","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:7e5045d216a8dbda3734b3abdaa0cd9a12d9039bf6a8e9b17a9e2dc4d3a64d5d","observation_id":"751382a5-04aa-4965-81d4-8ccb9b9d786e","resolution":{"observed_at":"2026-08-10T14:21:56.853600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.856216Z","title":"AudioLDM 2: Learning holistic audio generation with self-supervised pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.856216Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:1c629093686abe397c6bbc30c0be79b0aff032ff10b24c340af0258bf49ebcfa","observation_id":"e9daf869-0e4f-421d-84da-6f08dd825df4","resolution":{"observed_at":"2026-08-10T14:21:56.856216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.858980Z","title":"Spmis: An investigation of synthetic spoken misinformation detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.858980Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:f00ee3e3fc7ffa0994b5dba81ec867f283e30910030c0b190ff7407d5a94c510","observation_id":"0daa479a-36a8-4d05-9548-85956eaa945e","resolution":{"observed_at":"2026-08-10T14:21:56.858980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.861389Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.861389Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:659849e4bc7c8dec003b67df80005110fd9a2a847d8786a9aa5e8f0fae942307","observation_id":"7a15d40d-4942-49c7-927e-2320b348bbf8","resolution":{"observed_at":"2026-08-10T14:21:56.861389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.863539Z","title":"SingVisio: Visual Analytics of Diffusion Model for Singing V oice Conversion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.863539Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:26e6523f1c74db04352987f287184285516c2df0f653c70f0b0ecccafde2d379","observation_id":"8c69d4e2-7363-4e51-9465-699839311db4","resolution":{"observed_at":"2026-08-10T14:21:56.863539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-13T04:54:51.180904Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-10T14:21:56.866566Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.866566Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:4225e062f57cbbd2d1ed82e2264bb9284255dec51875a0bab21d5b2300c195f4","observation_id":"62909fd7-b90a-46aa-a123-24b808a9daba","resolution":{"observed_at":"2026-08-10T14:21:56.866566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.869648Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.869648Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:89f946852eb2b502d3e5d550c194864f876cbb776c0931c0aa3c5d5566cdc697","observation_id":"d771f84d-4c8b-48ae-87d7-8b2e412e3f38","resolution":{"observed_at":"2026-08-10T14:21:56.869648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.871990Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.871990Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:ad9ece5306283799a73e605b66e1c905f1dc00cf65ffa6e17ef0df818e73dc07","observation_id":"4e083cee-0276-452e-8084-e17077f69460","resolution":{"observed_at":"2026-08-10T14:21:56.871990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.874228Z","title":"Good debt or bad debt: Detecting semantic orientations in economic texts","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.874228Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:3a6ec75dba105c7a717704e6f942eefa0d4c072b80cd9f1bad7423233b033392","observation_id":"f78c517f-beb7-4566-8cf3-daece1325725","resolution":{"observed_at":"2026-08-10T14:21:56.874228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.877007Z","title":"Metrics for polyphonic sound event detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.877007Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:8a1c07909f42fd7048ae47e3c9967e6294629abc1bade9ad95c8062da2a452cd","observation_id":"2a5faf88-a32e-412b-b364-f63a82f54698","resolution":{"observed_at":"2026-08-10T14:21:56.877007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-09T04:16:37.543940Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-10T14:21:56.879183Z","title":"Mittag, B","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.879183Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:b78848673c353bbbc133819312e82c6c96e163f83319bcb4a1473a9f55ebdc82","observation_id":"772a9847-6895-4a12-a802-c361164763e7","resolution":{"observed_at":"2026-08-10T14:21:56.879183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.882423Z","title":"An overview of voice conversion systems","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.882423Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:51f1e2c4afde43bf91cda06d4f224b83e8b957c6295e516af6741751b74a7ce3","observation_id":"be6239ff-6433-45ef-88b9-8b13d5589a94","resolution":{"observed_at":"2026-08-10T14:21:56.882423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.886037Z","title":"Hansard speeches 1979-2021: Version 3.1.0, May 2021","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.886037Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:0aa88dd18a59c191a2b777a5213c843b5c622e2ab69614714984e78836a6eacb","observation_id":"1062cb0d-7448-46ff-98f5-c496848d655b","resolution":{"observed_at":"2026-08-10T14:21:56.886037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.889158Z","title":"Gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.889158Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:854aa300526af151330d2f79b894943040a90d9188c77d85983038bab736c44e","observation_id":"3475df66-9183-4e4e-92c4-78fcb57b39e8","resolution":{"observed_at":"2026-08-10T14:21:56.889158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.891618Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.891618Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:43b80d45c5db51e0d93135300764cdbff1cd4909984e5fa896579e3a470e4580","observation_id":"364f2c8b-2a90-4991-aadc-2312150043dc","resolution":{"observed_at":"2026-08-10T14:21:56.891618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.893787Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.893787Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:8b086e75a1dab9e87af216fa34357726e9f126a6c3589b19d8e2ec37986eb698","observation_id":"a8df1c6a-9f23-425f-a70f-6d89282ab138","resolution":{"observed_at":"2026-08-10T14:21:56.893787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.896152Z","title":"V oicecraft: Zero-shot speech editing and text-to-speech in the wild.ACL, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.896152Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:f3561383c87dbb2de55e951a81c71f5dbd3ff012a6f611f7b2f01ee47f264747","observation_id":"2ee8aea3-97e5-414e-a0a0-ee80d83cfa38","resolution":{"observed_at":"2026-08-10T14:21:56.896152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.899225Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.899225Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:c2b8e048b61f602f4bd494336e684ea70c6f813a19958fabd1783b5136e2dcf7","observation_id":"fab353a4-e01e-4ab0-be87-7f19a792c114","resolution":{"observed_at":"2026-08-10T14:21:56.899225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.901830Z","title":"MLS: A large-scale multilingual dataset for speech research","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.901830Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:46de33622b61ad1b90311f411dff83054f0b3d1106c0e43019d7b32b4698784c","observation_id":"e68ccfaa-670d-4791-95c7-cf8f8cafe421","resolution":{"observed_at":"2026-08-10T14:21:56.901830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.905232Z","title":"Autovc: Zero-shot voice style transfer with only autoencoder loss","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.905232Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:a030f484e68dd91aca9fb44873e851f71588592961effb2d7ce780a347727aa5","observation_id":"b6fc6744-af09-4801-b219-6af0621faa9b","resolution":{"observed_at":"2026-08-10T14:21:56.905232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01479","last_updated":"2024-08-18T16:36:50Z","snapshot_observed_at":"2026-08-13T05:10:53.274747Z","submitted_at":"2023-12-03T18:41:54Z","title":"OpenVoice: Versatile Instant Voice Cloning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01479","snapshot_observed_at":"2026-08-10T14:21:56.907998Z","title":"Openvoice: Versatile instant voice cloning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.907998Z"},"links":{"cited_paper":"/paper/2312.01479","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:880853e8f706087d80b151161e2b26f2c72102ac272e35cc52f1d02263c4f3d4","observation_id":"658cd23e-3afd-4df8-aec7-15e1ab0dad33","resolution":{"observed_at":"2026-08-10T14:21:56.907998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.910543Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.910543Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:8f9baa6a0e2a80df6c655346fe9778f61c1cfbf08a2f128ba4e60e29d2f1ec30","observation_id":"d8830185-5307-4992-b3b7-562759b70695","resolution":{"observed_at":"2026-08-10T14:21:56.910543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.913433Z","title":"The interspeech 2020 deep noise suppression challenge: Datasets, subjective testing framework, and challenge results","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.913433Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:ebdaaeef0ad9ac0ec1aa23350e1122a96ccb2cb64cf86e714ad369ceb96c0cc7","observation_id":"306cfa2c-6713-4be6-af9b-f5eada8dbcd2","resolution":{"observed_at":"2026-08-10T14:21:56.913433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.916029Z","title":"DNSMOS P.835: A Non-intrusive Perceptual Objective Speech Quality Metric to Evaluate Noise Suppressors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.916029Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:7a42942059b47249ebedb41f5f590462e4c8c5c665065db2634e030c23af0790","observation_id":"a81be4b7-0060-4613-9148-1aa974f936cf","resolution":{"observed_at":"2026-08-10T14:21:56.916029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:57.726975Z","title":"Speech enhancement and dereverberation with diffusion-based generative models","venue":null,"work_id":"e6493592-a1f2-45f4-9d12-e30b114f0f4c","year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.919107Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:386de29fce6c5b6559e53231516604b8ad2c5f3e1ad87e584a4e62031d88b91b","observation_id":"b1e98c69-2bcf-45be-85a6-892097c982be","resolution":{"observed_at":"2026-08-10T14:21:57.729870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.921691Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.921691Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:88fdef4c567830bf77251bd5b01cb446e92affb374078da5f7619766edf521df","observation_id":"24bb73cf-5e5c-452b-8e8d-ea820233e06f","resolution":{"observed_at":"2026-08-10T14:21:56.921691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16812","last_updated":"2024-09-01T14:34:27Z","snapshot_observed_at":"2026-08-13T04:32:01.197317Z","submitted_at":"2024-01-30T08:26:28Z","title":"SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16812","snapshot_observed_at":"2026-08-10T14:21:56.924127Z","title":"Speechbertscore: Reference-aware automatic evaluation of speech generation leveraging nlp evaluation metrics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.924127Z"},"links":{"cited_paper":"/paper/2401.16812","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:937abcf4f6f5896759a74775756f32ea96821b2d23c512538c6897a271617c2b","observation_id":"1cd1feb1-b882-4d8c-8e0e-605c54e75617","resolution":{"observed_at":"2026-08-10T14:21:56.924127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:57.714643Z","title":"Evaluating unsupervised text classification: Zero-shot and similarity-based approaches","venue":null,"work_id":"8b216738-127d-4c67-9440-e908f82ee96c","year":2022},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.926732Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:1e64af953061a647ca57631b85a8a9441372f40314b59681e7bd55b4bcae1c02","observation_id":"f167429b-ce25-434e-951c-1977be006263","resolution":{"observed_at":"2026-08-10T14:21:57.717454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-13T12:00:01.755113Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-10T14:21:56.928999Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.928999Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:5c1eb5c842ec626cd1242e8b35a5f8e47dc2e42f482c04fb4bd56009a89ddb66","observation_id":"6b004366-4aec-4027-a007-7715c7c60ad7","resolution":{"observed_at":"2026-08-10T14:21:56.928999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:57.706090Z","title":"An overview of voice conversion and its challenges: From statistical modeling to deep learning","venue":null,"work_id":"39e45071-e969-4e51-a372-ce5577f9cb39","year":2021},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.932067Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:233c7a8741bc9ebb1b6a55dcc55f6314b74aabeb2b5208c08cd862939d0ae908","observation_id":"3e9e726e-7e2a-42f3-98dd-581de78ff745","resolution":{"observed_at":"2026-08-10T14:21:57.709301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:57.698235Z","title":null,"venue":null,"work_id":"d8c07f0d-cf1d-4591-a459-c474fc20c0ca","year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.935434Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:1830c77851a6789e779d945be5e41b97ab0146389701f9721c00a60b653a13a2","observation_id":"4ae5d636-4c8e-49bc-a738-07d449a545d6","resolution":{"observed_at":"2026-08-10T14:21:57.701060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T14:21:56.937957Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.937957Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:70edeb2d67ad730e9b878ac34c015d5ce43a6713cdba47e3eb880d1cc46921bf","observation_id":"6b9fd21b-7514-4948-8813-2015322df657","resolution":{"observed_at":"2026-08-10T14:21:56.937957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:21:56.940453Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.940453Z"},"links":{"citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:bd129c5e36a6af98aea4119c2c7aa27133d4b5951ae0ac2c0b2ab27b4c0d2486","observation_id":"44d61262-95fb-4c55-8672-d87041da05c4","resolution":{"observed_at":"2026-08-10T14:21:56.940453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T05:22:54.792291Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":150},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 150 outbound references and 4 inbound Pith citation observations for arXiv:2501.15442."}