{"as_of":"2026-08-20T22:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c076348775513b40a98b126eefa2b96aa7a13e3f8ae3a9799871af7b4756617","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:05:11.464027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T11:27:03.142196Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:60703d70341543242c6309ce723b9ee5782d916df4f39373b0c4a88cf22dcda4","observation_id":"3ad2844e-c9f5-4714-bff0-1a4b7959d5fd","resolution":{"observed_at":"2026-05-12T18:57:28.775426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:20ef23fd13e5dc7042a99bfba1a2e5f58e6fdc08f411bff0fe27462cd22c3ad8","observation_id":"029a82d4-079b-478f-abb3-40d13ae9a8f8","resolution":{"observed_at":"2026-05-15T12:26:37.427555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T02:14:45.371564Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2407.10759"},"observation_digest":"sha256:de3d1e8ba1141708ec26a61c042d770fde6494e9854cb0f3eb0eff06ad5cb695","observation_id":"e4641d32-5c61-4246-ac0a-482b5848c79b","resolution":{"observed_at":"2026-05-11T02:14:45.481814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:0cf8dfe28752cafb324fef2964e7466e0e8d6b57eb9a818a792ffeeb6b4b69e0","observation_id":"f19d96cf-cee9-4b9d-a175-f7cc473c622b","resolution":{"observed_at":"2026-05-16T06:06:41.549207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-11T17:17:49.354349Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-19T16:13:49.463844Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T17:17:49.354349Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2412.09168"},"observation_digest":"sha256:6a122b6ee818bdcfad4af2c0e8cde3fbd1876db4dd31b7a7dc05e08b928bb800","observation_id":"1abb4ed1-d7bc-4696-a293-e4bab6d300a5","resolution":{"observed_at":"2026-08-11T17:17:49.354349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-10T21:27:45.551451Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04877","last_updated":"2025-01-08T23:21:43Z","snapshot_observed_at":"2026-08-14T00:45:11.064549Z","submitted_at":"2025-01-08T23:21:43Z","title":"Real-Time Textless Dialogue Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T21:27:45.551451Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2501.04877"},"observation_digest":"sha256:7df397c34e855e582877721a683dc94f8aecbef4c3455b6fbf9ff4fdca4064fe","observation_id":"02405732-ba93-47b7-b6f4-96fc2629f5f4","resolution":{"observed_at":"2026-08-10T21:27:45.551451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-09T05:54:18.511185Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-18T17:13:14.270187Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.511185Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:54c969802a7d84a70f92d024f16bc0ec16347ddc58aef4d9c0c68d7b2a6b4cb3","observation_id":"e4b04887-867e-437a-b4fc-f3046be5db61","resolution":{"observed_at":"2026-08-09T05:54:18.511185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-16T06:05:11.464027Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19146","last_updated":"2025-04-27T07:58:56Z","snapshot_observed_at":"2026-08-19T01:11:40.782554Z","submitted_at":"2025-04-27T07:58:56Z","title":"Muyan-TTS: A Trainable Text-to-Speech Model Optimized for Podcast Scenarios with a $50K Budget","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T06:05:11.464027Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2504.19146"},"observation_digest":"sha256:a77f5a034023ceb56d1aa4f272ee6b939a9215f5f916e215a20a33f7a274fbad","observation_id":"42fb6bf2-234e-4f52-8519-7e19cf27c6fb","resolution":{"observed_at":"2026-08-16T06:05:11.464027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-15T20:14:08.470461Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13843","last_updated":"2025-05-20T02:38:29Z","snapshot_observed_at":"2026-08-19T13:56:24.573069Z","submitted_at":"2025-05-20T02:38:29Z","title":"A Semantic Information-based Hierarchical Speech Enhancement Method Using Factorized Codec and Diffusion Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:08.470461Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2505.13843"},"observation_digest":"sha256:48e511a46744009f5121282ce103d48947e821f9df619315533fe222e759980f","observation_id":"629376f1-90e3-4113-994c-f94bc4b53cd7","resolution":{"observed_at":"2026-08-15T20:14:08.470461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:60c9e6e3c931701e759c1ed98e483be27a4816ab6b41e33dad38e1de266ef58d","observation_id":"884fbf92-8d19-4944-975d-4e40dafb05b1","resolution":{"observed_at":"2026-05-16T05:27:25.458153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-07T04:58:07.617554Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit, 2023.https://arxiv.org/abs/2305.11013","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-08T17:53:50.843512Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.617554Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:1fd9dae28b31f1e020011c71d142e59d65519b2c6b5ffe2b3ba1cec815a7b354","observation_id":"70a0d441-835b-48cb-9407-933b084066dc","resolution":{"observed_at":"2026-08-07T04:58:07.617554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T22:20:13.728503Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21865","last_updated":"2025-06-27T02:40:00Z","snapshot_observed_at":"2026-08-20T02:29:01.258966Z","submitted_at":"2025-06-27T02:40:00Z","title":"RiverEcho: Real-Time Interactive Digital System for Ancient Yellow River Culture","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:13.728503Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2506.21865"},"observation_digest":"sha256:cdff422de952652915f0bbb4c5893802691329a6cb7f5f543bbf1a397259fbc7","observation_id":"5b16968f-f463-4b34-8c15-fb9c2251b1bb","resolution":{"observed_at":"2026-08-06T22:20:13.728503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T15:48:23.415106Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.415106Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:41a0b581f8446a3542cbdeeee76ef9d4fe13c2910448dd634d54f1d3bc67780a","observation_id":"5bf1f8fd-29cf-44d3-b2d5-a4c8a7b6e62e","resolution":{"observed_at":"2026-08-06T15:48:23.415106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T15:07:26.953516Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit.arXiv preprint arXiv:2305.11013, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16884","last_updated":"2025-07-22T16:26:58Z","snapshot_observed_at":"2026-08-18T07:30:55.578021Z","submitted_at":"2025-07-22T16:26:58Z","title":"SplitMeanFlow: Interval Splitting Consistency in Few-Step Generative Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:26.953516Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2507.16884"},"observation_digest":"sha256:c42cc520834e7dbeed327358a3061dc2b1ea519186c634971a30589ba51a34f5","observation_id":"d38cbefd-6d7e-4e97-b19d-251648fe0990","resolution":{"observed_at":"2026-08-06T15:07:26.953516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T06:04:29.876089Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-20T08:17:17.638415Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.876089Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:0f0a81cb34b6cca6a6b6b754dd078f74a554358684051bcc318646fa14ef65e4","observation_id":"ac1f3415-c111-4879-a6d0-e4066fe59202","resolution":{"observed_at":"2026-08-06T06:04:29.876089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T05:05:26.342534Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit.arXiv preprint arXiv:2305.11013, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.342534Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:b210dcb96cbe9419612f95fd4cd0a8e2925850433585f9bc2c021f0d5e0ad868","observation_id":"af261e11-cd76-4626-a8df-d031500f5e34","resolution":{"observed_at":"2026-08-06T05:05:26.342534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T00:51:30.009070Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.009070Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:12cc85754ac49812c5b001104baa73dbde91fa1dc17167869b0318446732bcc8","observation_id":"b679bf31-2d50-4682-94bf-78ffa0bfacc2","resolution":{"observed_at":"2026-08-06T00:51:30.009070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-05T10:16:21.154166Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04324","last_updated":"2025-09-04T15:42:36Z","snapshot_observed_at":"2026-08-18T07:30:53.970098Z","submitted_at":"2025-09-04T15:42:36Z","title":"OVGrasp: Open-Vocabulary Grasping Assistance via Multimodal Intent Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:16:21.154166Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2509.04324"},"observation_digest":"sha256:7390868ffc3769316aa50abfafdafffbeb6c400f5cc239dfac4b4e7f2ee9b4c7","observation_id":"3e7dee25-57bb-44b1-8618-6dca5ab4f017","resolution":{"observed_at":"2026-08-05T10:16:21.154166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2511.09282","last_updated":"2026-04-11T11:33:33Z","snapshot_observed_at":"2026-08-11T12:41:23.442130Z","submitted_at":"2025-11-12T12:49:30Z","title":"End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-17T22:44:49.949759Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2511.09282"},"observation_digest":"sha256:321d4147ef592698c5464fa188b21ff8505e3c6d9b35770bdb6ca20f5d6e9625","observation_id":"2303f6b9-62c9-446c-981c-2b260579df84","resolution":{"observed_at":"2026-05-17T22:45:24.300261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-13T23:27:58.971096Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit.arXiv preprint arXiv:2305.11013, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16859","last_updated":"2026-07-01T09:16:52Z","snapshot_observed_at":"2026-08-12T16:11:36.690343Z","submitted_at":"2026-03-17T17:58:44Z","title":"SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:58.971096Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2603.16859"},"observation_digest":"sha256:da7ebb6a0f0d281aad80fc02bb78ca51477e6b092f658210af4ab8c31d5921a6","observation_id":"76e7137b-e86d-491d-abc7-8aeff764eece","resolution":{"observed_at":"2026-07-13T23:27:58.971096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2605.07478","last_updated":"2026-05-08T09:23:29Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:23:29Z","title":"AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T01:51:29.385520Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2605.07478"},"observation_digest":"sha256:aecaa5ce688dfe70ab2ae747a7e31cdc6e4d6e0c3a9c29389c1de16e753dafa2","observation_id":"233cc8ab-de9b-4889-88be-9f91a35479ce","resolution":{"observed_at":"2026-05-11T04:20:55.273904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2605.22732","last_updated":"2026-05-21T17:03:37Z","snapshot_observed_at":"2026-08-19T03:54:51.439538Z","submitted_at":"2026-05-21T17:03:37Z","title":"Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T04:54:35.815868Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2605.22732"},"observation_digest":"sha256:5d211b5d167d34c90d1eceb60d059827da56199b352d89742def9229919fcae4","observation_id":"c9b3087a-ded2-474f-a585-9c328d49f5ae","resolution":{"observed_at":"2026-05-22T04:56:05.281227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:a7ff5f4b6f77c0d9a3fdb70204254907f1d45f55312fb911e650a8beffefbda9","observation_id":"d235f828-8034-4223-a655-4712c715573e","resolution":{"observed_at":"2026-07-02T01:06:23.860879Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-18T07:30:52.697166Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:8ef765bb7e1399c0ac58675b0c51609e84f9b48f2d7cdadc902612f4f1a41623","observation_id":"6ec8d7f1-8f17-47db-9598-021d3bb1e87a","resolution":{"observed_at":"2026-07-04T12:09:49.451429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":171,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:839aace230d9095f8ccd90785e32e89ca168636e25766b0470e999f0526864f0","observation_id":"914d7818-2ee7-424b-8676-1cf91c95e82c","resolution":{"observed_at":"2026-07-01T11:45:47.188685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2607.08208","last_updated":"2026-07-16T03:28:30Z","snapshot_observed_at":"2026-08-16T19:40:33.470468Z","submitted_at":"2026-07-09T08:07:34Z","title":"Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T11:18:43.887987Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2607.08208"},"observation_digest":"sha256:eb33f28e037ddda2bad7287e805a2ce59d840ba56e8c7b7c9224a4fc8a878d1d","observation_id":"f6548111-d76a-43b9-a2f2-93c09fac96e8","resolution":{"observed_at":"2026-07-10T11:27:03.143835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-02T07:58:45.439616Z","title":"FunASR: A fundamental end-to- end speech recognition toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08208","last_updated":"2026-07-16T03:28:30Z","snapshot_observed_at":"2026-08-16T19:40:33.470468Z","submitted_at":"2026-07-09T08:07:34Z","title":"Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T07:58:45.439616Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2607.08208"},"observation_digest":"sha256:29e81fb15be69f73c900be1e83c7d3974231f90a942d734fb2e75768f5a378b8","observation_id":"ce05492e-c9bd-43a6-9817-f50342cdc1cf","resolution":{"observed_at":"2026-08-02T07:58:45.439616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-31T23:35:23.937463Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit.arXiv preprint arXiv:2305.11013, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23938","last_updated":"2026-07-27T02:30:15Z","snapshot_observed_at":"2026-08-19T01:36:33.366404Z","submitted_at":"2026-07-27T02:30:15Z","title":"Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T23:35:23.937463Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2607.23938"},"observation_digest":"sha256:669820466260d1f9f2a17a0d7d813bd150c7bdbd57fd919558013ed2b34ebaca","observation_id":"a1ab0643-701f-4c6b-9525-15fb7ab44527","resolution":{"observed_at":"2026-07-31T23:35:23.937463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-16T00:37:04.911143Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit.arXiv preprint arXiv:2305.11013, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.911143Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:f6ddb2c96f89061117e4e76daa9929e12f496b4f918acd66c70a29d0f472b0ca","observation_id":"ee9a78e7-0c36-4084-b44b-9198b2f3fd84","resolution":{"observed_at":"2026-08-16T00:37:04.911143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.11013/citation-record","integrity":"/paper/2305.11013/integrity","json":"/paper/2305.11013/citation-record.json","paper":"/paper/2305.11013"},"outbound":[],"paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2305.11013."}