{"as_of":"2026-08-09T16:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7396c66d3e52227e74d6486fc47d8e03908fb102479ed0b08214f53b679fd15b","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:51:32.702267Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:01:52.696984Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T14:25:02.434510Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:51e32feb9e473514ed42853af0493acbfb4f9d09d8833a14aa8b6f05c5bc3ab0","observation_id":"dc465a96-f3af-4c05-bdc3-c67a12c398db","resolution":{"observed_at":"2026-05-13T23:03:24.826968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2604.16211","last_updated":"2026-04-21T13:32:36Z","snapshot_observed_at":"2026-08-01T22:51:55.583851Z","submitted_at":"2026-04-17T16:20:55Z","title":"NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T07:37:44.393592Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2604.16211"},"observation_digest":"sha256:47d248a4b001d8f88657f8741373f675c3462d8e26cb157a87aeccab82dd828e","observation_id":"610ee6e7-2250-4543-8895-9e5295d4fd57","resolution":{"observed_at":"2026-05-10T07:47:13.005685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2604.22225","last_updated":"2026-04-24T05:01:55Z","snapshot_observed_at":"2026-07-06T23:08:42.301487Z","submitted_at":"2026-04-24T05:01:55Z","title":"TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T12:03:11.243693Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2604.22225"},"observation_digest":"sha256:ed2b85096ae11ffc88d3d9f1b2a56b4480e6b74984f3f7b8a6db576394a21e1e","observation_id":"ecc84b56-edce-420c-b44d-25ffcba4899c","resolution":{"observed_at":"2026-05-11T19:21:09.976948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2605.12036","last_updated":"2026-05-12T12:19:33Z","snapshot_observed_at":"2026-08-02T08:39:14.773302Z","submitted_at":"2026-05-12T12:19:33Z","title":"Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T04:03:27.608638Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2605.12036"},"observation_digest":"sha256:4a8e980388c677e6c096e2ca503e31ab742db141d1fa4f22d145680238293905","observation_id":"16435fef-12da-4d26-819a-82ef45fa8ac9","resolution":{"observed_at":"2026-05-13T04:07:13.507801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2607.01563","last_updated":"2026-07-02T00:43:14Z","snapshot_observed_at":"2026-08-02T20:14:44.151587Z","submitted_at":"2026-07-02T00:43:14Z","title":"Beyond Words: Towards Effective Modeling of Non-Verbal Vocalizations in ASR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T00:29:39.365107Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2607.01563"},"observation_digest":"sha256:763c8f5ac4be16be0907265fabacd050b1fe779ee8443e7ac8f5ae0a051cb57c","observation_id":"8eb7ae9c-ae45-4db1-b2f8-41d6733a6577","resolution":{"observed_at":"2026-07-03T00:37:29.604600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2607.06179","last_updated":"2026-07-07T11:57:26Z","snapshot_observed_at":"2026-08-08T05:06:20.291056Z","submitted_at":"2026-07-07T11:57:26Z","title":"TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T14:20:24.828073Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2607.06179"},"observation_digest":"sha256:f9d2b78868c25d2a10a6cd130ba5083281aeefdb7c60e6820227f5be693b80f1","observation_id":"780fd3bc-2880-4093-a9f3-601039e19f43","resolution":{"observed_at":"2026-07-08T14:25:02.436023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-08-01T14:01:52.696984Z","title":"NVSpeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18934","last_updated":"2026-07-21T10:19:17Z","snapshot_observed_at":"2026-08-06T17:35:33.329523Z","submitted_at":"2026-07-21T10:19:17Z","title":"Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:01:52.696984Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2607.18934"},"observation_digest":"sha256:8f431e19febf195b7bdb788b8767cb8980aac6a50ed552b6fb0320b58bbc17da","observation_id":"d6960b66-d470-4ba4-9ba0-c4a9026b2694","resolution":{"observed_at":"2026-08-01T14:01:52.696984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.04195/citation-record","integrity":"/paper/2508.04195/integrity","json":"/paper/2508.04195/citation-record.json","paper":"/paper/2508.04195"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:29.419290Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.419290Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:6a8fcd89b03c34191a675f8f2615bad82f58b62024a1b8f1f02531e0a60b795b","observation_id":"a7329c7c-d665-42d1-83e9-0297e80d850d","resolution":{"observed_at":"2026-08-06T00:51:29.419290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:29.470752Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.470752Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:bd631e038308bca97578be150dd262968a84334636f4eea45dcf212467038248","observation_id":"72272a94-9074-45d3-9444-56577ac6960d","resolution":{"observed_at":"2026-08-06T00:51:29.470752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-06T00:51:29.524524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.524524Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:1ed61a782bb944f4bf11a04bf1482f7783867f22c886f408186981b148296da3","observation_id":"001b74c3-9d4b-4ac2-b2fd-de1a1b7f24b0","resolution":{"observed_at":"2026-08-06T00:51:29.524524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01339","last_updated":"2024-03-31T00:38:02Z","snapshot_observed_at":"2026-08-06T17:35:41.454428Z","submitted_at":"2024-03-31T00:38:02Z","title":"Humane Speech Synthesis through Zero-Shot Emotion and Disfluency Generation","version":1},"cited_work":{"arxiv_id":"2404.01339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01339","snapshot_observed_at":"2026-08-06T00:51:33.198619Z","title":"Humane Speech Synthesis through Zero-Shot Emotion and Disfluency Generation","venue":"cs.CL","work_id":"042e3538-2208-493e-a807-a1c56bc387b2","year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.579149Z"},"links":{"cited_paper":"/paper/2404.01339","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:f8c89b2752afc471987a2eedee357013badd0a10df3ed8e8b19c834a5d3c2307","observation_id":"bc2d1ba8-8745-4564-bf8f-7f57b24c0aa9","resolution":{"observed_at":"2026-08-06T00:51:33.246231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T00:51:29.678062Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.678062Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:b374ae91d624a1246d5430ecc82833a7b2b79dbbf3af896c8359acf4083cb535","observation_id":"f7251430-0160-4158-b836-a7496021ba59","resolution":{"observed_at":"2026-08-06T00:51:29.678062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T00:51:29.737750Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.737750Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:e1b95cc923c8e71a48f0aab8d5be1bcfd5fb6c463c4d5ee79d1a920312d36b1e","observation_id":"c2d1e50e-b985-4320-bbcb-8f6a59ffe200","resolution":{"observed_at":"2026-08-06T00:51:29.737750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T00:51:29.827602Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.827602Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:ad985867f9a3cf079a3dbc2487db58fc626ff4410fcd0649451bd1ce8dc54edf","observation_id":"9ca561e2-bdbc-49fa-8171-9c771a950e8b","resolution":{"observed_at":"2026-08-06T00:51:29.827602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:36.476817Z","title":null,"venue":null,"work_id":"8c0a16eb-922b-4785-bf48-ee37280a3853","year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.891439Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:2d01931b544262490b5841a5f423ba11801797a86f704ea4b6a1ceb2e9d0144e","observation_id":"c3fbd9e7-19a0-47af-93b3-4c819a8ee3e5","resolution":{"observed_at":"2026-08-06T00:51:36.556797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T00:51:29.957770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.957770Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:b2ea0ceac81b5458c004a81ff432ad53ae7655313a2d767bcdbf6db678a310b4","observation_id":"ea8f7aa4-6cb6-4a43-a588-7b5dfc2e2fbf","resolution":{"observed_at":"2026-08-06T00:51:29.957770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-08T00:35:10.506000Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T00:51:30.009070Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.009070Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:b12a04d646d777374c39035a52618fd0d9d4c04b186a61b08d707d34389253f6","observation_id":"b679bf31-2d50-4682-94bf-78ffa0bfacc2","resolution":{"observed_at":"2026-08-06T00:51:30.009070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-06T00:51:30.106597Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.106597Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:4e03e4e653f96be0aa334beeae9a15b8f24b1a1b4becc6b280cf050b72271252","observation_id":"15c7e2f3-41c4-4e96-ba2e-5ba58fe90610","resolution":{"observed_at":"2026-08-06T00:51:30.106597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:36.297200Z","title":"F.; Ellis, D","venue":null,"work_id":"525002c6-3f8a-4bad-ae63-2afe3601c864","year":2017},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.179764Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:b1b830e825dd8d94be18ffe8d57811a37bc0f067d82dac4a41e9ea050edcf512","observation_id":"89df5f50-df60-457b-bc39-d774e3dc31b9","resolution":{"observed_at":"2026-08-06T00:51:36.375230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:36.147447Z","title":null,"venue":null,"work_id":"3b256834-0503-4972-b61c-c341ee916575","year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.195673Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:8287b388cd6308fc28c71ce3a4488b3fe61b855ca72675064ae402cddc7ae42b","observation_id":"331361af-2510-447b-bd02-e88df15243df","resolution":{"observed_at":"2026-08-06T00:51:36.216252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.955667Z","title":null,"venue":null,"work_id":"5eeacdcd-2513-4034-bba9-bf1e6b11f4b0","year":2006},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.296507Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:242ef46c4e477dd6e118f59502f6ac446fd64f28baab715ca928e7fe560756a5","observation_id":"0deb0d0e-f8ba-4bf9-bad0-278bc699f7b0","resolution":{"observed_at":"2026-08-06T00:51:36.042699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-06T00:51:30.398007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.398007Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:ae4246bafcf5c746b921a720eae6b69a58d53f8a862d1567d29bee856138990f","observation_id":"c671d657-7cf7-46fc-a3ff-b7c02cdf8e9e","resolution":{"observed_at":"2026-08-06T00:51:30.398007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.828916Z","title":null,"venue":null,"work_id":"be329d9a-0806-411b-a3f3-63e764b792d0","year":2016},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.527531Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:81aeeeae941fa42e9d5f6cd224800bf2a96b190f349b6b4c2f0f24d09e8e4400","observation_id":"4b1c2fe0-0dfc-4965-84d1-e33b4bc65832","resolution":{"observed_at":"2026-08-06T00:51:35.882856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:30.658204Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.658204Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:7c73459e9afed8f0b4617fdc937f176751ab366869accfa058b8d90042ea2ddc","observation_id":"edc42f4b-f738-489b-bf02-57c465a9e932","resolution":{"observed_at":"2026-08-06T00:51:30.658204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07383","last_updated":"2024-03-04T19:15:29Z","snapshot_observed_at":"2026-08-08T09:24:37.491001Z","submitted_at":"2024-02-12T02:58:10Z","title":"Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07383","snapshot_observed_at":"2026-08-06T00:51:30.769766Z","title":"E.; Thakker, M.; Yang, H.; Zhu, Z.; Tang, M.; Li, C.; Tsai, C.-H.; Xiao, Z.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.769766Z"},"links":{"cited_paper":"/paper/2402.07383","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:f9799b13fa4e4c4dfeeaf6105d87d681ec652c041d300722794556751bca59de","observation_id":"ee47a100-26eb-4ef5-ba87-838361fe724a","resolution":{"observed_at":"2026-08-06T00:51:30.769766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.640337Z","title":"S.; and Aslin, R","venue":null,"work_id":"91d543ec-5855-4b3f-a446-3fe59d666139","year":2011},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.924211Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:0c25b388ded340e6d4b23eab946dbdf2feea63dbd99ab16ae8fae804e63b8fcc","observation_id":"3b946c59-8ff3-4d57-96c4-14438a6cac74","resolution":{"observed_at":"2026-08-06T00:51:35.727651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.501167Z","title":null,"venue":null,"work_id":"c805a21e-0128-480a-80ec-7e1fbfc87ff9","year":2020},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.118101Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:376a93b5543082ee792d448b1388e955025c872a48efcb1a08af706058bd86d8","observation_id":"6f58bd19-c46a-484a-ba33-d99fb23b5c44","resolution":{"observed_at":"2026-08-06T00:51:35.582626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.348590Z","title":"M.; and Nass, C","venue":null,"work_id":"233e9fc1-dddd-4357-adca-1d459d3ad953","year":2003},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.272438Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:5a8ebb9154cdbefb85b86942978e62115d91129c2f6ac889e5ad018cce25909c","observation_id":"c48991fa-e5de-4190-a353-fa8ff95e2e32","resolution":{"observed_at":"2026-08-06T00:51:35.440905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.204439Z","title":"E.; Rohde, H.; and Corley, M","venue":null,"work_id":"c7c90956-c353-4d6c-bd56-6ef3197a6da0","year":2017},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.335779Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:5ac043ce57162062bc8d7512e0f381aae75c1ffd49b55cec14145becd923cf23","observation_id":"7d22d4cb-c8e1-4550-a9c7-783d4027daf7","resolution":{"observed_at":"2026-08-06T00:51:35.276295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-07-06T16:04:58.235073Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-06T00:51:31.393989Z","title":"A.; Hsu, W.-N.; d'Avirro, A.; Shi, B.; Gat, I.; Fazel-Zarani, M.; Remez, T.; Copet, J.; Synnaeve, G.; Hassid, M.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.393989Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:f5bf970dc8302c1fb1d7b1951d3f04a4a3f6c5afb08bef1e869f8db78e00bab5","observation_id":"4402f487-40f7-461f-be2d-02e40eaa173d","resolution":{"observed_at":"2026-08-06T00:51:31.393989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.060389Z","title":null,"venue":null,"work_id":"327deb32-21d4-44fb-a26c-9557b4a4849d","year":2014},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.467268Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:156509ec9facb763d53229b73414aee9918d608f00e690bf629cf71e2bfbe38e","observation_id":"90a046bd-2328-42d7-be3b-53404aae77a4","resolution":{"observed_at":"2026-08-06T00:51:35.131919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:31.540103Z","title":"W.; Xu, T.; Brockman, G.; McLeavey, C.; and Sutskever, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.540103Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:035ac9e7de453af457580928bc89007841815d7d589cbbdb03c5ba947cbd991b","observation_id":"4d568a58-48f6-438a-bb20-7a83a32d2c25","resolution":{"observed_at":"2026-08-06T00:51:31.540103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.916663Z","title":"M.; Li, G.; and Du, C","venue":null,"work_id":"dad8362c-f594-47f2-a312-0c1e02154772","year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.638027Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:2297ac1e5c4bb63d31bbaecb0f49387655c3d032a0e53bcb514209bafd258c02","observation_id":"e61ee274-39f3-4365-b648-63172564e471","resolution":{"observed_at":"2026-08-06T00:51:34.968392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.698687Z","title":null,"venue":null,"work_id":"63df8673-20af-4948-83e1-442f816578c7","year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.749455Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:3909c2fcdce3c32371563b19e04aa0b046b7dd336cd1f610601981d5e0ed9e83","observation_id":"f1c1672f-6204-4d98-aea6-49563bb65895","resolution":{"observed_at":"2026-08-06T00:51:34.794508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-06T00:51:31.866776Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.866776Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:8baa8c37887daf15ec59fb474551adbfe24ceead13c3398435d8d7cf921e91f3","observation_id":"2ac5f453-ff97-419e-b111-48e6799535e2","resolution":{"observed_at":"2026-08-06T00:51:31.866776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.485980Z","title":null,"venue":null,"work_id":"4b36f567-9c25-40fd-9812-911724f616a0","year":2013},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.939646Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:d524a74bf8f8ba7f14dcd88345bcbc049b033112cbf1b27218102e50efc2dc6d","observation_id":"350cd4e5-6116-4810-85fa-692f7834aa6d","resolution":{"observed_at":"2026-08-06T00:51:34.623200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.281029Z","title":null,"venue":null,"work_id":"e53c4117-1a66-442a-bc16-9b724b5b7fef","year":2017},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.025999Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:60e164cabd1a6bb81bd20fb079b22b92ef87e96bb0e370236c960415046075d6","observation_id":"85795783-f8c7-4e9e-9ce3-5e4595ae444a","resolution":{"observed_at":"2026-08-06T00:51:34.396959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-08-08T12:28:23.489422Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-06T00:51:32.131382Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.131382Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:205f4a1e54006190da2bc5c707c19b3c07dec27b322fc224c4316cb28ccbf29f","observation_id":"c679a6ea-d81e-483d-a059-f530be6fd47f","resolution":{"observed_at":"2026-08-06T00:51:32.131382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.009414Z","title":null,"venue":null,"work_id":"140268b4-c089-4454-8153-d1c9a4c88923","year":2003},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.233349Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:4d606295643d3e2dc4a116d15b6557ee285e2e2e0e77f6545969331a6c1313be","observation_id":"c2447670-cbd6-4f8c-9fac-3720882b3d2a","resolution":{"observed_at":"2026-08-06T00:51:34.094456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:33.768400Z","title":null,"venue":null,"work_id":"f26e1af3-d908-4c68-a4e4-59666ca851d0","year":2013},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.333796Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:71ced2a47549051e3f511b1cce2d69d9cb584dc792cd503d5366ac84ffdea079","observation_id":"24c5b1c2-1b12-4404-9cba-5c97d514214d","resolution":{"observed_at":"2026-08-06T00:51:33.881745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08820","last_updated":"2024-06-13T05:23:22Z","snapshot_observed_at":"2026-08-05T13:52:58.067417Z","submitted_at":"2024-06-13T05:23:22Z","title":"DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage","version":1},"cited_work":{"arxiv_id":"2406.08820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08820","snapshot_observed_at":"2026-08-06T00:51:32.844249Z","title":"DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage","venue":"eess.AS","work_id":"8a5ac57b-d56a-42e0-990a-43fa081c3e77","year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.388095Z"},"links":{"cited_paper":"/paper/2406.08820","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:8b0251c4280fda9cc7b6edcb3f682698823d489c742607236fdc0905757bdd84","observation_id":"701de64b-c30b-4506-bb16-5bd8000d593d","resolution":{"observed_at":"2026-08-06T00:51:32.888098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:33.597101Z","title":null,"venue":null,"work_id":"c195b4bf-0b2d-471c-8dc3-408146db52c3","year":2006},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.480445Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:39b3abe8aafee380262f5951f25fa7f80bdf12802dca1ae156215c4a05d1621f","observation_id":"fe9c6c71-7323-4996-bf15-f3cd272cfa16","resolution":{"observed_at":"2026-08-06T00:51:33.665539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:33.448798Z","title":"E.; Thakker, M.; Tompkins, D.; Tsai, C.-H.; Li, C.; Xiao, Z.; Zhao, S.; Li, J.; et al","venue":null,"work_id":"93f295fa-0031-4216-9069-17d14581fb47","year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.557490Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:e3cbedaa9c59d9dfa75d6f6332077f35cbf8b5781175d59d171b5e87d02be051","observation_id":"e1eb9f8d-3177-42f9-a402-81b86bc9775d","resolution":{"observed_at":"2026-08-06T00:51:33.505371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16844","last_updated":"2022-03-31T07:01:06Z","snapshot_observed_at":"2026-07-06T12:55:09.694305Z","submitted_at":"2022-03-31T07:01:06Z","title":"Open Source MagicData-RAMC: A Rich Annotated Mandarin Conversational(RAMC) Speech Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16844","snapshot_observed_at":"2026-08-06T00:51:32.620801Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.620801Z"},"links":{"cited_paper":"/paper/2203.16844","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:1a816bf90ab5df244dd76743a795cc3e1fcc51624c203eedfeba30c214601c3b","observation_id":"352d1629-f1fb-4857-a0c5-0c74c2bd5a9d","resolution":{"observed_at":"2026-08-06T00:51:32.620801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:33.314511Z","title":null,"venue":null,"work_id":"de2359d1-ff47-4b67-a504-41b1c0e30c0f","year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.702267Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:35100707dc1c15bf7ba8bda05e134bd48c73f6ea1c2de14a0d218bc5d313f19c","observation_id":"b3f16aa5-609e-407f-8418-baa6bc143a82","resolution":{"observed_at":"2026-08-06T00:51:33.368415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 7 inbound Pith citation observations for arXiv:2508.04195."}