{"as_of":"2026-08-18T14:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80ba55c4c837cda1496f4e30c53ea70119ce61a5475a7db4a1862655de6b9542","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:08:24.290299Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:06:23.909166Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2409.18512","last_updated":"2026-04-03T15:54:23Z","snapshot_observed_at":"2026-08-15T04:45:12.011452Z","submitted_at":"2024-09-27T07:46:52Z","title":"Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T20:31:24.494060Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2409.18512"},"observation_digest":"sha256:46bdd30ff4a499a070cfee2f909fa9405866031bf83013c75ecd859e00514286","observation_id":"222b4700-42e0-42cf-a599-33585aa123cf","resolution":{"observed_at":"2026-05-23T20:33:25.602164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-11T18:08:21.797820Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.797820Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:2366e10dc788fe3554d8701c9602aaffd0e6cb0cfa9df5f8dd73e880c55b4a8e","observation_id":"f2025600-be32-418c-900e-0c687c575d17","resolution":{"observed_at":"2026-08-11T18:08:21.797820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-11T11:18:34.483158Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15622","last_updated":"2024-12-20T07:28:04Z","snapshot_observed_at":"2026-08-13T18:08:12.828161Z","submitted_at":"2024-12-20T07:28:04Z","title":"TouchASP: Elastic Automatic Speech Perception that Everyone Can Touch","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:34.483158Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2412.15622"},"observation_digest":"sha256:4de1207c3d43f8f7a34901f495fc799a41b76f7f88295361efd58a6ab63666be","observation_id":"c62ae441-4e2d-4dcb-b07a-c612e73b1b12","resolution":{"observed_at":"2026-08-11T11:18:34.483158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-11T11:18:39.919302Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-12T05:23:04.133755Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:18:39.919302Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2412.15649"},"observation_digest":"sha256:61ad00a30d9d929af63ff0b4faa759decf7a01741840676b345e68c243313b6a","observation_id":"4382f760-a711-4ee5-b5ae-8b9d71ea80c7","resolution":{"observed_at":"2026-08-11T11:18:39.919302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-09T05:54:18.506600Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-13T03:10:13.532495Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.506600Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:7a8ac4ef8536f46772a1f7f6ae5aff92872e167605e21018427c5b2781eac96a","observation_id":"1b89e85a-0dd9-495a-aa05-62feb8f82cbd","resolution":{"observed_at":"2026-08-09T05:54:18.506600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-08T19:07:00.580468Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-16T07:12:07.706546Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.580468Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:321afdf72dfa68a8b88f59d7c089bc652b1744c5c2ee93d7ee536cf53873e3ea","observation_id":"97b06b7c-850a-4ebe-9f0e-e9a21b7871f5","resolution":{"observed_at":"2026-08-08T19:07:00.580468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:37757dc27cdfdc584c430d523196212f2bf76f0a57683a391048311b8e4860b5","observation_id":"828da4f7-53b1-4efe-aa1f-31d64759fe8c","resolution":{"observed_at":"2026-05-18T13:39:48.353222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:6bd310ad32cf531faddad0bf0f042f880d75f7d3c84d27592d99b377bd1ac013","observation_id":"1f548302-e5a7-433f-8a8f-b5d1805bab94","resolution":{"observed_at":"2026-05-11T19:21:27.255745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-16T04:08:24.290299Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01998","last_updated":"2025-05-06T16:09:59Z","snapshot_observed_at":"2026-08-16T17:54:52.147544Z","submitted_at":"2025-05-04T06:03:12Z","title":"A Synergistic Framework of Nonlinear Acoustic Computing and Reinforcement Learning for Real-World Human-Robot Interaction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:24.290299Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.01998"},"observation_digest":"sha256:3a4a908443927ca99f69350d01bc6b726cf3fc598ff184273dce44431f1b1349","observation_id":"a6baf30b-227a-4c82-85d4-7a0eaacee85f","resolution":{"observed_at":"2026-08-16T04:08:24.290299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T15:43:04.928529Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-18T11:51:27.345842Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.928529Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:1b424b26c01bc5992946993608417a4d97f88613393bff0956a134c1b8b8f75b","observation_id":"1494347b-02b1-43d7-9318-d5ff6fcb3771","resolution":{"observed_at":"2026-08-07T15:43:04.928529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T14:53:15.212421Z","title":"Paraformer: Fast and accu- rate parallel transformer for non-autoregressive end-to- end speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-16T18:13:29.906602Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.212421Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:7c08022e36ec91526adb29774937a335498d7280e6abbf6175833c19e12f1aa3","observation_id":"a113fd37-95e0-4b9c-8a1b-a3282570a878","resolution":{"observed_at":"2026-08-07T14:53:15.212421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T14:09:21.735893Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-18T07:29:44.183618Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.735893Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:5d252d8261ba645232bec250c01793d4e946c95d1b75abc744ac972b7685e619","observation_id":"90899022-b9f2-4eb0-b263-3c169974ec9f","resolution":{"observed_at":"2026-08-07T14:09:21.735893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T13:23:29.774239Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22013","last_updated":"2025-05-28T06:22:37Z","snapshot_observed_at":"2026-08-14T13:49:37.051871Z","submitted_at":"2025-05-28T06:22:37Z","title":"Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:23:29.774239Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.22013"},"observation_digest":"sha256:2efabfe37b58fe7c2c59ab38cc944214e127cf338a7a244a5990e2a6f58441ab","observation_id":"5fa2184b-201e-41e5-a057-78f648ed1c48","resolution":{"observed_at":"2026-08-07T13:23:29.774239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T11:02:26.108415Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-15T16:45:54.242978Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.108415Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:b1aff7f1e6e7d3b387c5b559281b646732329d248285db482ed6a8a12c77684a","observation_id":"d174e39a-ca50-44cc-a430-4fe19c142abe","resolution":{"observed_at":"2026-08-07T11:02:26.108415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T05:18:04.512944Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08346","last_updated":"2025-06-10T02:01:00Z","snapshot_observed_at":"2026-08-13T14:23:38.216919Z","submitted_at":"2025-06-10T02:01:00Z","title":"SPBA: Utilizing Speech Large Language Model for Backdoor Attacks on Speech Classification Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:04.512944Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2506.08346"},"observation_digest":"sha256:c79ca6bca2a99aa8d5be4775aea351764618212d962c1a7cb10aea9abe39d1b4","observation_id":"95e7ba4e-414d-465f-a4cc-d4fa5501a9a1","resolution":{"observed_at":"2026-08-07T05:18:04.512944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T05:20:56.456677Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08348","last_updated":"2025-06-10T02:05:15Z","snapshot_observed_at":"2026-08-14T12:21:50.787477Z","submitted_at":"2025-06-10T02:05:15Z","title":"Pureformer-VC: Non-parallel Voice Conversion with Pure Stylized Transformer Blocks and Triplet Discriminative Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:20:56.456677Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2506.08348"},"observation_digest":"sha256:e62ed52354565b376d2dae0f3b9d884eea23ea6dcd7ebcdff01f0bf81b25925f","observation_id":"9d9b5c92-6c73-4621-bdb8-6ffb89b708d1","resolution":{"observed_at":"2026-08-07T05:20:56.456677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T05:03:12.369009Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition.arXiv preprint arXiv:2206.08317, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-15T16:35:33.798128Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.369009Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:67e4eeeb3b50a7b4cd2c429f71b0fdf04a27416a99330d75ae03250df1bc1359","observation_id":"debb1561-7cd4-450d-94b9-44605811f8d0","resolution":{"observed_at":"2026-08-07T05:03:12.369009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-06T00:51:30.106597Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.106597Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:f5b335c31901d6a2f08086aa407cb7f0d52296b38e79411873d94efc9ad6699d","observation_id":"15c7e2f3-41c4-4e96-ba2e-5ba58fe90610","resolution":{"observed_at":"2026-08-06T00:51:30.106597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-04T11:29:31.898662Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-13T22:52:06.796347Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:31.898662Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:982344c8d51b248f71b264c9818236a322466c60e52e16580de2d218ea6c3699","observation_id":"c517b810-88e0-407e-b179-ac0b573fca67","resolution":{"observed_at":"2026-08-04T11:29:31.898662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2511.09282","last_updated":"2026-04-11T11:33:33Z","snapshot_observed_at":"2026-08-11T12:41:23.442130Z","submitted_at":"2025-11-12T12:49:30Z","title":"End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T22:44:49.949759Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2511.09282"},"observation_digest":"sha256:b779dc482880b68ce2567327b84dcc31d3984e82607f39f53779a2be66cc39db","observation_id":"a10173c8-91a5-4cbd-8f28-23cc58d73280","resolution":{"observed_at":"2026-05-17T22:45:24.288565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2602.12783","last_updated":"2026-07-14T13:03:26Z","snapshot_observed_at":"2026-08-04T18:25:49.070689Z","submitted_at":"2026-02-13T10:08:27Z","title":"SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T22:47:12.521942Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2602.12783"},"observation_digest":"sha256:ce07ed81d2bda36417a6d36702b1b18e5d0cc926806a1481f0b870832c5b2ac3","observation_id":"7a76e5c9-9474-456f-bf2c-79f7d2992d83","resolution":{"observed_at":"2026-05-15T22:50:22.461335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-02T23:46:58.784038Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.12783","last_updated":"2026-07-14T13:03:26Z","snapshot_observed_at":"2026-08-04T18:25:49.070689Z","submitted_at":"2026-02-13T10:08:27Z","title":"SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T23:46:58.784038Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2602.12783"},"observation_digest":"sha256:0019189add5f2e1bf78e02645fa17027d209f4050bb8131f9d5c6a47c0b812da","observation_id":"390ea4ae-0720-4e05-8d1f-0c5641c47885","resolution":{"observed_at":"2026-08-02T23:46:58.784038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-14T19:56:33.793167Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.01895","last_updated":"2026-04-02T10:59:55Z","snapshot_observed_at":"2026-08-17T06:14:14.627094Z","submitted_at":"2026-04-02T10:59:55Z","title":"Sharp spectral estimates for free boundary problems arising in plasma physics","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T19:56:33.793167Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2604.01895"},"observation_digest":"sha256:37fe7d4a6ca9503703f1cb8f172440e85735c0140d2d7f50be919ef538d8b1d8","observation_id":"3a218924-635c-40b9-9eb5-6ef356531470","resolution":{"observed_at":"2026-07-14T19:56:33.793167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T20:55:09.141906Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2604.01897"},"observation_digest":"sha256:f531eddf47580080e335c69436e98dae8107db121bebc821405ffb85780d7495","observation_id":"5f21f90e-e9a0-40d0-b66f-115203513c80","resolution":{"observed_at":"2026-05-13T20:58:15.980213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2604.08000","last_updated":"2026-04-09T09:06:13Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T09:06:13Z","title":"PASK: Toward Intent-Aware Proactive Agents with Long-Term Memory","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:05:40.242925Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2604.08000"},"observation_digest":"sha256:773c0bb0a10e27d6d292a5fdb179e08142987fc408450de9aca6df2b6bac5639","observation_id":"7b96ebcf-607e-4dd1-b921-64ce271e9f9e","resolution":{"observed_at":"2026-05-11T05:30:59.832806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2604.13073","last_updated":"2026-03-20T17:25:00Z","snapshot_observed_at":"2026-08-15T16:34:57.668583Z","submitted_at":"2026-03-20T17:25:00Z","title":"OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T08:06:45.477344Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2604.13073"},"observation_digest":"sha256:35181428576298b3e296fa5f0d542c6c0dba3bd93b81829eca41645ab148bf9c","observation_id":"8f1db52f-f5f9-4afd-aa38-18b418df7870","resolution":{"observed_at":"2026-05-15T08:09:51.387608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2604.21406","last_updated":"2026-04-24T04:15:19Z","snapshot_observed_at":"2026-08-16T13:54:57.694543Z","submitted_at":"2026-04-23T08:21:52Z","title":"Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T13:19:44.156822Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2604.21406"},"observation_digest":"sha256:b4284388e1cc558ee4c7ebf7b00bba5e789fd75bcd3d888eda7e31072d690907","observation_id":"3af10abc-078f-43c7-a277-5c2c4e92bd8f","resolution":{"observed_at":"2026-05-11T18:56:06.748583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-11T13:23:12.680939Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:9d7ff4139eab8ac02bacc84735b666ca6f486fe4b78d07b15fb7e87a96171ba5","observation_id":"b1409b32-a39e-40b5-b817-0069e580424e","resolution":{"observed_at":"2026-05-11T04:50:55.775112Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2605.10027","last_updated":"2026-05-11T05:50:51Z","snapshot_observed_at":"2026-08-16T02:15:11.559624Z","submitted_at":"2026-05-11T05:50:51Z","title":"Speech-based Psychological Crisis Assessment using LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T03:29:30.208874Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2605.10027"},"observation_digest":"sha256:c9abbc19432451219e68d05962508b445baf66e96b38f19754a42d94b393d6f9","observation_id":"729957f9-91ee-489e-a459-65dea4f53de0","resolution":{"observed_at":"2026-05-12T07:21:23.408668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-15T02:27:40.157038Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:03721a3c77b1b97699b6d26534ae123c1263ac744786ee883103102abdacb2e3","observation_id":"f4eb1ede-32e2-4e7d-8aef-3877653bd09e","resolution":{"observed_at":"2026-07-02T01:06:23.910895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-01T17:45:44.024035Z","title":"arXiv preprint arXiv:2206.08317 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-17T21:54:04.970629Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:44.024035Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:217849003c340b2d66a98a2db30428043025c7f7e669ffc768e7958486f55411","observation_id":"85c1e9cc-32e7-4d3b-9141-c4418fea87ea","resolution":{"observed_at":"2026-08-01T17:45:44.024035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2206.08317/citation-record","integrity":"/paper/2206.08317/integrity","json":"/paper/2206.08317/citation-record.json","paper":"/paper/2206.08317"},"outbound":[],"paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T09:11:25.213121Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2206.08317."}