{"as_of":"2026-08-18T00:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ef7f70f69632033575af7fc4ad061b118feba37a51f79e3e43ead0a6b63e752","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":72,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:38:53.974812Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T20:34:09.701797Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-12T21:27:18.836309Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08742","last_updated":"2024-11-13T16:20:20Z","snapshot_observed_at":"2026-08-16T05:45:09.735060Z","submitted_at":"2024-11-13T16:20:20Z","title":"A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T21:27:18.836309Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2411.08742"},"observation_digest":"sha256:dc7bb192c93d7e09c17419dcc89e575661940b45bb25f1abad7cd592b99544b8","observation_id":"8a18530a-2ebd-472d-880f-03b06f2bb154","resolution":{"observed_at":"2026-08-12T21:27:18.836309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-12T17:27:49.083893Z","title":"& Others Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12587","last_updated":"2024-11-19T15:55:56Z","snapshot_observed_at":"2026-08-13T22:45:07.515597Z","submitted_at":"2024-11-19T15:55:56Z","title":"Whisper Finetuning on Nepali Language","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:27:49.083893Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2411.12587"},"observation_digest":"sha256:e14cff6e482d0da83c67038254f5317353c32a7cc286b23b573265ba5163778d","observation_id":"7ab94963-c9e0-4eb6-93b1-b26583bf40eb","resolution":{"observed_at":"2026-08-12T17:27:49.083893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-12T20:13:57.074793Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.074793Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:e36c9dbe81b6c5376de315dde30aea8bef32d404b9eb53aac3cbb4e45c37a745","observation_id":"4db6cd1f-8b9a-4688-a0af-bcaaf51a1b75","resolution":{"observed_at":"2026-08-12T20:13:57.074793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-11T16:56:06.012180Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-12T23:49:37.475723Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:56:06.012180Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2412.09596"},"observation_digest":"sha256:45cf003812eb12050e9c5a349e5e6ad7f368303fd42ec46a6c9913cfc9497467","observation_id":"30b85e59-2d2d-4431-a9e5-654e150edb9e","resolution":{"observed_at":"2026-08-11T16:56:06.012180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-11T11:18:33.321155Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15622","last_updated":"2024-12-20T07:28:04Z","snapshot_observed_at":"2026-08-13T18:08:12.828161Z","submitted_at":"2024-12-20T07:28:04Z","title":"TouchASP: Elastic Automatic Speech Perception that Everyone Can Touch","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:33.321155Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2412.15622"},"observation_digest":"sha256:6ce39f3cb45f248c2e14d2739ec8be39e9b9d3972f554de357d7e293f53a75b7","observation_id":"b4c048bb-6d54-4e1b-8abd-1e3a9e20b0c1","resolution":{"observed_at":"2026-08-11T11:18:33.321155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-11T11:09:12.931762Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15838","last_updated":"2024-12-30T07:27:58Z","snapshot_observed_at":"2026-08-16T14:52:33.599355Z","submitted_at":"2024-12-20T12:27:16Z","title":"Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:09:12.931762Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2412.15838"},"observation_digest":"sha256:3b37f21b01ac1fd7f63e1476c51bae92be4a7b2ef9e2c27d7d0a330d9335b374","observation_id":"c1a21545-2c5e-419e-929b-ef44887ff30c","resolution":{"observed_at":"2026-08-11T11:09:12.931762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-11T05:41:33.127633Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-17T00:11:56.581601Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.127633Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:f3340d1ccc69023bdfd8ef26138d28f7cffe36540f4ab7557842a95859112769","observation_id":"24beb63f-628e-4a50-ad59-36a4a5a335d0","resolution":{"observed_at":"2026-08-11T05:41:33.127633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-11T14:59:01.322175Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-17T08:41:51.069276Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.322175Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:d81365f65167652f01e076f5f926377bede727069e7f4fbf32b7efd82e1214c3","observation_id":"c846a0c2-7942-4035-9215-f616b19fe0a9","resolution":{"observed_at":"2026-08-11T14:59:01.322175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-15T09:15:43.841019Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:337a939cb886597bdcca5f0c927ce6978300f8518f16722e56b5b0d4d9124894","observation_id":"93415f77-b6eb-4f7d-a13a-7e99a0715fb7","resolution":{"observed_at":"2026-05-17T21:08:19.775669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-10T14:40:55.164421Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-13T14:25:54.211530Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:40:55.164421Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2501.15111"},"observation_digest":"sha256:8190ec899d58f1cc92ff971e2b1d8378a03a37ee330c5c17d0024b133b3cd01f","observation_id":"9f0b1b95-91c9-4d0e-8c6e-06143f7f07cb","resolution":{"observed_at":"2026-08-10T14:40:55.164421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-09T19:16:37.885007Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00377","last_updated":"2025-02-01T09:29:21Z","snapshot_observed_at":"2026-08-16T09:56:33.713959Z","submitted_at":"2025-02-01T09:29:21Z","title":"When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T19:16:37.885007Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2502.00377"},"observation_digest":"sha256:c3ce66a122d48352148e7d2f2c00a7cbf26fa9600e175b6eb0fbd7d359aece1c","observation_id":"c68a647c-86b7-4515-9d19-a420d719dd5a","resolution":{"observed_at":"2026-08-09T19:16:37.885007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-09T05:54:18.440103Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-13T03:10:13.532495Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.440103Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:8ed9718d8491e3ff25a69a12cd5f4bab84875baedd511297d97d99f9aec3dc89","observation_id":"3bf0e655-85f2-4d3f-9b8b-37945160f7b0","resolution":{"observed_at":"2026-08-09T05:54:18.440103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-08T22:47:39.053243Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-14T09:13:56.327308Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.053243Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:69676f95a548ece2affccc0ee24e00f5ac8fb47f8cd23b3d2a42b84fafb8da92","observation_id":"339dcc89-68b2-4e8b-ab24-4856fa4e70ca","resolution":{"observed_at":"2026-08-08T22:47:39.053243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-08T14:47:08.004692Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06664","last_updated":"2025-02-24T10:07:54Z","snapshot_observed_at":"2026-08-08T14:41:57.380685Z","submitted_at":"2025-02-10T16:51:11Z","title":"Evaluation of Deep Audio Representations for Hearables","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T14:47:08.004692Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2502.06664"},"observation_digest":"sha256:ae790069b6e195516fb1e1bea90bbbf63f6a2527c2404b6fb2ef88dac9db0c1a","observation_id":"dc0f1a0c-da2c-42f6-9c52-6db19d93f9c0","resolution":{"observed_at":"2026-08-08T14:47:08.004692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-16T12:38:53.974812Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12254","last_updated":"2025-04-19T09:55:40Z","snapshot_observed_at":"2026-08-16T12:31:49.196170Z","submitted_at":"2025-04-16T17:05:14Z","title":"Advancing Arabic Speech Recognition Through Large-Scale Weakly Supervised Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:38:53.974812Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2504.12254"},"observation_digest":"sha256:05effe06fe3968469c73e42590032c39609764603f03093b4c5e7a53eacaa3a3","observation_id":"1260c168-220b-46b3-905e-6764d7681cbe","resolution":{"observed_at":"2026-08-16T12:38:53.974812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:e1bb70e19bf7f4ddc9ae384e0db6ff28b56060b796ce81efa79e1c7916f2195f","observation_id":"42c60449-ed93-428c-8f9b-b216f18f5e12","resolution":{"observed_at":"2026-05-11T19:21:27.160148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-15T21:52:53.397615Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08699","last_updated":"2025-05-14T02:10:29Z","snapshot_observed_at":"2026-08-15T23:01:43.367826Z","submitted_at":"2025-05-13T15:58:57Z","title":"Granite-speech: open-source speech-aware LLMs with strong English ASR capabilities","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:52:53.397615Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.08699"},"observation_digest":"sha256:2dde560032cfca8b2347b50746e74eb0cfdf26861ef9bf9484a9065b5a4908fa","observation_id":"c62cb1a9-98d8-40f0-9cf9-153aa3c703e3","resolution":{"observed_at":"2026-08-15T21:52:53.397615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-15T21:20:25.251918Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10596","last_updated":"2025-05-15T10:03:05Z","snapshot_observed_at":"2026-08-17T16:54:34.494753Z","submitted_at":"2025-05-15T10:03:05Z","title":"Inclusivity of AI Speech in Healthcare: A Decade Look Back","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:20:25.251918Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.10596"},"observation_digest":"sha256:a5b00bc8e775fd126472106c23e00f25ce0284072e327f97dce532c9c7e26c9f","observation_id":"7402db6e-24e3-42a7-a81c-af7fabe7ee52","resolution":{"observed_at":"2026-08-15T21:20:25.251918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-15T20:19:15.068168Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13404","last_updated":"2025-05-21T17:00:54Z","snapshot_observed_at":"2026-08-15T20:12:16.405190Z","submitted_at":"2025-05-19T17:40:58Z","title":"Granary: Speech Recognition and Translation Dataset in 25 European Languages","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:15.068168Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.13404"},"observation_digest":"sha256:dad2e66295f62816d6517e155bc7b1da14a7e35e107db8cbd2f39490d35214ab","observation_id":"f1424ff3-c562-4105-8186-aa8cf416a15e","resolution":{"observed_at":"2026-08-15T20:19:15.068168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T15:03:28.008270Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16490","last_updated":"2025-05-25T10:12:09Z","snapshot_observed_at":"2026-08-16T10:24:00.475922Z","submitted_at":"2025-05-22T10:22:15Z","title":"HPP-Voice: A Large-Scale Evaluation of Speech Embeddings for Multi-Phenotypic Classification","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:28.008270Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.16490"},"observation_digest":"sha256:00940eef6f8d780ec134fc047f3b9908ba106511d83ecc68a2d128cd9bb8c4ea","observation_id":"ddd816b8-bd3f-4403-b5fd-9e9f06e09840","resolution":{"observed_at":"2026-08-07T15:03:28.008270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T14:42:04.923875Z","title":"arXiv:2106.06909 [cs]","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17841","last_updated":"2025-05-23T12:55:33Z","snapshot_observed_at":"2026-08-14T05:05:44.596019Z","submitted_at":"2025-05-23T12:55:33Z","title":"TEDI: Trustworthy and Ethical Dataset Indicators to Analyze and Compare Dataset Documentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:04.923875Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.17841"},"observation_digest":"sha256:cbd6b6bc0cfd67123e0a3d7d15a57901042fbfbc034848d785e6963605b0239e","observation_id":"1ba5252f-5ee5-4872-bef6-831bfa81de8b","resolution":{"observed_at":"2026-08-07T14:42:04.923875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T14:17:56.327895Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.327895Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:1f810b9a2708864ad75228f5fbdcc3be83ab7f294d0332586cc745553854161a","observation_id":"b6c69078-b779-436a-8e7e-6dc2e647e0ad","resolution":{"observed_at":"2026-08-07T14:17:56.327895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T13:49:21.093321Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-15T05:38:42.941028Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.093321Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:29b7406d3dd8943a8c52117847fb52f08be400d2d4f55591d42706c8d079bb63","observation_id":"48f8d9f6-776d-4b89-85bd-820eb4c85620","resolution":{"observed_at":"2026-08-07T13:49:21.093321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T12:11:46.821940Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00267","last_updated":"2025-06-11T08:02:37Z","snapshot_observed_at":"2026-08-10T21:42:46.223186Z","submitted_at":"2025-05-30T22:03:59Z","title":"CASPER: A Large Scale Spontaneous Speech Dataset","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:46.821940Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.00267"},"observation_digest":"sha256:8231beababc7575b6734d975813f431af4544ce453398813ac82232ad45f771d","observation_id":"b9409cea-226f-4a71-8934-78f224063019","resolution":{"observed_at":"2026-08-07T12:11:46.821940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T12:03:23.318170Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00736","last_updated":"2025-05-31T22:51:36Z","snapshot_observed_at":"2026-08-09T04:35:50.309243Z","submitted_at":"2025-05-31T22:51:36Z","title":"IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:23.318170Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.00736"},"observation_digest":"sha256:659dfba68748e6c2bd73026cf80681aca447703ff9925630d94071a91b49e023","observation_id":"4953a05e-06d3-4de5-8514-3180d6571e33","resolution":{"observed_at":"2026-08-07T12:03:23.318170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T11:28:41.066944Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-16T07:09:53.771363Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:41.066944Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:6965b2706b6949bac60f408cf27ea001f0867c96802a8f660d0d1fa326b02833","observation_id":"3d25116b-720e-4bed-b17b-d3100c804aa7","resolution":{"observed_at":"2026-08-07T11:28:41.066944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T11:16:31.762687Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-14T01:43:51.204987Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.762687Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:1886c6edae386a72f876cd91c92c3c326149d399423cb863b6cd104b858adce2","observation_id":"2c4cdf49-992a-4d22-a6ff-09981ad38bb5","resolution":{"observed_at":"2026-08-07T11:16:31.762687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T10:55:20.342184Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-15T00:07:07.659454Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.342184Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:54e6e253a26953904ce43ac52d3ee84e2b41805cd6ccb31d0f87d6ff53cdf5aa","observation_id":"b1d1b093-dbc2-468e-83ea-b92226d3d12a","resolution":{"observed_at":"2026-08-07T10:55:20.342184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-15T19:32:52.575179Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16127","last_updated":"2025-06-19T08:24:17Z","snapshot_observed_at":"2026-08-16T06:37:28.377698Z","submitted_at":"2025-06-19T08:24:17Z","title":"Improved Intelligibility of Dysarthric Speech using Conditional Flow Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:32:52.575179Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.16127"},"observation_digest":"sha256:6fbe7c5b6d66036c80509adafa77de2da0d5b173d911bfc52c1589a8a736356b","observation_id":"3470d9a5-a1c5-459d-9c1d-a7bd6143cace","resolution":{"observed_at":"2026-08-15T19:32:52.575179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-06T22:41:07.185729Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-16T15:49:09.216949Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.185729Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:f1a24d1fba30a7e738685c3e642b802640d556ce734b9833801d3c9c1f6b53f1","observation_id":"beb48705-2f65-4847-94ff-a778753b0bd1","resolution":{"observed_at":"2026-08-06T22:41:07.185729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-06T22:18:12.222702Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21990","last_updated":"2025-06-27T07:57:13Z","snapshot_observed_at":"2026-08-13T13:18:08.227597Z","submitted_at":"2025-06-27T07:57:13Z","title":"Analyzing and Fine-Tuning Whisper Models for Multilingual Pilot Speech Transcription in the Cockpit","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:12.222702Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.21990"},"observation_digest":"sha256:92860f1b4f2b1d80f556781e4d1f549667d1df94e223c8f9006d7d85378b8c35","observation_id":"16578a72-185e-49e9-96be-25c9a678c37e","resolution":{"observed_at":"2026-08-06T22:18:12.222702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-06T18:33:16.997764Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07877","last_updated":"2025-08-01T20:13:43Z","snapshot_observed_at":"2026-08-16T03:18:00.238717Z","submitted_at":"2025-07-10T16:00:27Z","title":"Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:16.997764Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2507.07877"},"observation_digest":"sha256:e118eb30f200c66fbb691153faa204823f6dda506d260a25d543356f9c17f02a","observation_id":"2b71415f-4c51-4d89-a66a-02a530104bb8","resolution":{"observed_at":"2026-08-06T18:33:16.997764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-08-17T22:20:20.496099Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T03:42:44.523919Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2507.08128"},"observation_digest":"sha256:d1eabdb2115b3ea22eba0a59caa9af1986f07c6b6addfb29500af6a6db52e832","observation_id":"b6883eb5-7f96-4603-9ce0-1d88626dbdbe","resolution":{"observed_at":"2026-05-15T03:42:44.738231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-06T18:27:53.805528Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-13T13:09:58.555275Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.805528Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:27175c72b71a2bf18cff94f58705832d7fc1e324ef0f9d40fe60f020a920d6a4","observation_id":"3da493c0-b1b5-47cc-afeb-a8ec8a9fa604","resolution":{"observed_at":"2026-08-06T18:27:53.805528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-06T14:45:26.487908Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.18051","last_updated":"2025-07-24T02:56:29Z","snapshot_observed_at":"2026-08-14T00:50:37.532708Z","submitted_at":"2025-07-24T02:56:29Z","title":"The TEA-ASLP System for Multilingual Conversational Speech Recognition and Speech Diarization in MLC-SLM 2025 Challenge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:26.487908Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2507.18051"},"observation_digest":"sha256:5b88fbcda8f2ebe810f2797a9e82ddcedb5a3cdfe28edb4e6c2e489e6b6786c4","observation_id":"d5156ee4-8fc9-44d8-9f7d-ac6a252ac9bb","resolution":{"observed_at":"2026-08-06T14:45:26.487908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-05T20:31:45.946423Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10k hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-17T19:19:01.605954Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.946423Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5bea20757ea70b8d7602c54658baa6b4d54451a30cea0f8175f8ba27cda392db","observation_id":"0a05ab93-c5b3-4b3c-9891-049835cbe534","resolution":{"observed_at":"2026-08-05T20:31:45.946423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-15T17:28:10.217367Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12061","last_updated":"2025-08-16T14:26:59Z","snapshot_observed_at":"2026-08-15T17:23:15.533934Z","submitted_at":"2025-08-16T14:26:59Z","title":"VARAN: Variational Inference for Self-Supervised Speech Models Fine-Tuning on Downstream Tasks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:28:10.217367Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2508.12061"},"observation_digest":"sha256:2acb59595d244983683c4681a37849c88d184eb0070abd6dd73c14f7483d1e75","observation_id":"52c13a8d-bb18-4c53-8442-e9b31c5ffe1c","resolution":{"observed_at":"2026-08-15T17:28:10.217367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-05T20:01:03.619245Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.14916","last_updated":"2025-08-15T10:39:05Z","snapshot_observed_at":"2026-08-17T04:17:16.326780Z","submitted_at":"2025-08-15T10:39:05Z","title":"Transsion Multilingual Speech Recognition System for MLC-SLM 2025 Challenge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:01:03.619245Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2508.14916"},"observation_digest":"sha256:643f3375757f6446cba09b32455221dcf2457557092ec4f085173b0519a3834c","observation_id":"501501f7-ad34-4fb3-a70f-02e0dd2f7e04","resolution":{"observed_at":"2026-08-05T20:01:03.619245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-05T17:56:50.891846Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-14T16:19:43.372797Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:50.891846Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:90a243927a922e43da6f2f62057cf878e1e927ca95037db58e78637d46d38afa","observation_id":"2ef66db8-5f36-4677-96d1-51de0a0f3860","resolution":{"observed_at":"2026-08-05T17:56:50.891846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-05T16:46:47.691984Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-16T04:41:17.152030Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.691984Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:9c1b1b411bfab9d31bec853b944c0f86a4bbb8b7d3e8aa7aacf5b730b6cae0f8","observation_id":"59d58ead-f7e1-4f16-a889-aa6095d78d70","resolution":{"observed_at":"2026-08-05T16:46:47.691984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-05T15:39:22.341037Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19671","last_updated":"2025-08-27T08:31:01Z","snapshot_observed_at":"2026-08-15T07:50:51.589419Z","submitted_at":"2025-08-27T08:31:01Z","title":"Hybrid Decoding: Rapid Pass and Selective Detailed Correction for Sequence Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:39:22.341037Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2508.19671"},"observation_digest":"sha256:b6ee6dee6068063c838adc0d0881d1f67d1ec487707847ac32456c644ad61f37","observation_id":"3e896d81-0b83-4218-a502-514d47561471","resolution":{"observed_at":"2026-08-05T15:39:22.341037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-15T16:12:07.877383Z","title":"Gigaspeech: An evolv- ing, multi-domain asr corpus with 10,000 hours of tran- scribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08476","last_updated":"2025-09-10T10:27:41Z","snapshot_observed_at":"2026-08-15T16:00:04.633889Z","submitted_at":"2025-09-10T10:27:41Z","title":"Audio Deepfake Verification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:12:07.877383Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2509.08476"},"observation_digest":"sha256:e1d63c219335f7d1385210315cdff1f82d9cb02b90ce91c81e33f58f17785ad4","observation_id":"45ad6b17-a9c7-4b66-a224-3486e2a55fb8","resolution":{"observed_at":"2026-08-15T16:12:07.877383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-11T16:37:46.886811Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:07e5a696dc5776fbb3d4686a9e8c64dde6bd85714b11be06d382f6ecf0db6c4c","observation_id":"3f991931-c0a6-40ee-a174-58eef507336e","resolution":{"observed_at":"2026-05-18T13:01:24.309499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-03T12:01:01.032776Z","title":"Gigaspeech: An evolving, multi-domai n asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.19919","last_updated":"2026-06-01T03:38:43Z","snapshot_observed_at":"2026-08-14T08:18:38.359501Z","submitted_at":"2026-01-08T08:05:30Z","title":"ASKD-Whisper: Adaptive Self-knowledge Distillation for Efficient and Low-Latency Automatic Speech Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T12:01:01.032776Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2601.19919"},"observation_digest":"sha256:252417e603dad71981098e54a25802ec9f0dce694ae08c599be6ae26baff30fd","observation_id":"67ef9509-bed9-4fba-a2c6-3335ddaeeb53","resolution":{"observed_at":"2026-08-03T12:01:01.032776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-14T19:56:33.793167Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2604.01895","last_updated":"2026-04-02T10:59:55Z","snapshot_observed_at":"2026-08-17T06:14:14.627094Z","submitted_at":"2026-04-02T10:59:55Z","title":"Sharp spectral estimates for free boundary problems arising in plasma physics","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T19:56:33.793167Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2604.01895"},"observation_digest":"sha256:6ca569da8c9f68d0e979e4d3f44f54772396116056826849c69aa6a5d6827910","observation_id":"1a29ff68-8741-4f7c-9515-2653e64cea0d","resolution":{"observed_at":"2026-07-14T19:56:33.793167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T20:55:09.141906Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2604.01897"},"observation_digest":"sha256:fdff4cd3dfe820437b361aeb18453b3ae3ae2ba10fd1b0d5ba0497acc0c4dd78","observation_id":"49f5d046-cb19-44bc-ba56-f6dbee7fc1bc","resolution":{"observed_at":"2026-05-13T20:58:15.985611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2604.08003","last_updated":"2026-04-09T09:07:52Z","snapshot_observed_at":"2026-08-15T12:24:31.594968Z","submitted_at":"2026-04-09T09:07:52Z","title":"Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:06:50.408402Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2604.08003"},"observation_digest":"sha256:680303daf47f7c7b0cf2faf05621580c05ae80578ef35f5125ae722ccd52312b","observation_id":"a88ddcd8-5c1b-4e75-821f-7f5efe39d2f3","resolution":{"observed_at":"2026-05-11T05:30:57.573353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2604.09121","last_updated":"2026-04-14T06:45:50Z","snapshot_observed_at":"2026-08-11T12:40:31.299771Z","submitted_at":"2026-04-10T09:02:42Z","title":"Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T18:22:08.670559Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2604.09121"},"observation_digest":"sha256:372006e5834a242f6efaa337373e94a9c33008554f93f269f36c8cfcc3547a74","observation_id":"befac34a-ccf9-4788-82e2-266637a6f6f6","resolution":{"observed_at":"2026-05-11T00:41:07.146906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":207,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:9e2045972360c79342e0910982405c57c70c6d7e9906448faf5bfae7d75150b3","observation_id":"50615cdb-2663-4062-b444-913c348a35bf","resolution":{"observed_at":"2026-05-11T08:30:56.956560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2604.14186","last_updated":"2026-03-31T16:56:33Z","snapshot_observed_at":"2026-08-15T01:16:58.124900Z","submitted_at":"2026-03-31T16:56:33Z","title":"HARNESS: Lightweight Distilled Arabic Speech Foundation Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T02:17:14.045133Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2604.14186"},"observation_digest":"sha256:e774c96e831b8dbac33733b833dc10f8777e1a2132b30b3b798cbc2e095da819","observation_id":"19713299-624b-4ae6-98cc-34828054b3a6","resolution":{"observed_at":"2026-05-11T22:56:14.218117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2604.17435","last_updated":"2026-04-19T13:34:52Z","snapshot_observed_at":"2026-08-13T07:41:22.005610Z","submitted_at":"2026-04-19T13:34:52Z","title":"MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T05:36:07.090627Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2604.17435"},"observation_digest":"sha256:9c9a39c5dfdf410e65b0c3e9dd9778d8431b54dfdea66806b688da71b2db9364","observation_id":"e5a2f0f4-37b2-4d07-90fc-62420c64bad7","resolution":{"observed_at":"2026-05-10T05:41:02.468559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2604.24794","last_updated":"2026-04-25T23:17:26Z","snapshot_observed_at":"2026-08-11T08:43:29.054192Z","submitted_at":"2026-04-25T23:17:26Z","title":"V.O.I.C.E (Voice, Ownership, Identity, Control, Expression): Risk Taxonomy of Synthetic Voice Generation From Empirical Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T07:46:23.931059Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2604.24794"},"observation_digest":"sha256:bbac071fa578e1b94f753f4d12bf6751e1999e942642c3ef7d0cb4eef08efcd1","observation_id":"35d924f2-8145-43ef-9cf0-e82ec750015f","resolution":{"observed_at":"2026-05-11T20:51:14.576247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-16T23:48:33.860447Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:239143030c19dd2020cdcbfa3248a28065dc4c4f6df367213c76771a8df529d8","observation_id":"a16c3f7f-e9ca-40e2-bb3e-6f23844d1146","resolution":{"observed_at":"2026-05-11T15:46:46.275282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:7862f15572c25571b6b7171c830345f7d9332055e1ff3cb8d7bae15a9edea560","observation_id":"03e116d0-4672-4b0f-9492-ee2972551b38","resolution":{"observed_at":"2026-05-11T19:46:15.384531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:cde34242282879563eb44cde7d5a707f3870e3278eb89f76a778766dc90ec46d","observation_id":"cc7acf4a-e9b9-45bc-9fb3-58dcb36f1766","resolution":{"observed_at":"2026-05-11T00:50:49.600593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-11T13:23:12.680939Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:6d1e797d33859190fa64c476110df538b9cf8559d4c100f11f205ba90436bad0","observation_id":"cfe9b6dc-fde0-4cc0-82a5-b1a57952a8d8","resolution":{"observed_at":"2026-05-11T04:50:56.222701Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2605.20830","last_updated":"2026-05-20T07:21:36Z","snapshot_observed_at":"2026-08-17T06:26:22.986921Z","submitted_at":"2026-05-20T07:21:36Z","title":"Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T02:32:26.122526Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2605.20830"},"observation_digest":"sha256:0fec9c08052a2081d52fc898849a7aaae616ea5640a4667531c070311c08e57d","observation_id":"a8cc4277-ef35-4b6e-9809-1634e7d965f4","resolution":{"observed_at":"2026-05-21T02:33:55.423216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:63f604ddc6d0f1049cd85a2f3988beb4803dfcda8b0ab5ecd9851750cc310424","observation_id":"ef5668f7-499d-475e-bb4d-8c27062d0c79","resolution":{"observed_at":"2026-06-29T23:04:01.787035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2605.29430","last_updated":"2026-05-28T06:23:31Z","snapshot_observed_at":"2026-08-14T01:51:14.504250Z","submitted_at":"2026-05-28T06:23:31Z","title":"Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T07:30:11.718647Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2605.29430"},"observation_digest":"sha256:8234760a2df024c70f79ba580c82109fa306a0cb5a3021f408bb7ee966ea59e6","observation_id":"7b8c78ff-3fb0-44c9-8187-4d9844e2d9c2","resolution":{"observed_at":"2026-06-29T07:33:13.728960Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2606.01483","last_updated":"2026-05-31T22:54:57Z","snapshot_observed_at":"2026-08-14T06:27:31.699966Z","submitted_at":"2026-05-31T22:54:57Z","title":"MURMUR: An Efficient Inference System for Long-Form ASR","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T17:06:02.978205Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2606.01483"},"observation_digest":"sha256:1f2e0e0b4031228437905cf440fab094c8709fbe898525de8354464c333c578a","observation_id":"02b22fe6-8a57-4ebc-866d-17c377016d92","resolution":{"observed_at":"2026-06-28T17:12:25.104029Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2606.18273","last_updated":"2026-06-05T11:38:30Z","snapshot_observed_at":"2026-08-12T18:50:06.738816Z","submitted_at":"2026-06-05T11:38:30Z","title":"Continuous Audio Thinking for Large Audio Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:49.839901Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2606.18273"},"observation_digest":"sha256:453548a51d331eff7f7e79b1d64c991b56d727c7377a04692c95a352415f1513","observation_id":"df26543a-e4ae-420f-b718-dd98e6bece8f","resolution":{"observed_at":"2026-07-02T17:47:18.017535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2606.22310","last_updated":"2026-06-21T02:35:22Z","snapshot_observed_at":"2026-08-16T06:14:22.260530Z","submitted_at":"2026-06-21T02:35:22Z","title":"Learning to Evade: Adaptive Attacks on Audio Watermarking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T10:10:18.351233Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2606.22310"},"observation_digest":"sha256:d19b2dabd8528d8d1b6683ee805bbf01aee6ecb547c5cbf9d4cb123271432694","observation_id":"b621edce-4dd5-46e3-9a4f-e21b0914857d","resolution":{"observed_at":"2026-07-04T09:19:43.956144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":"2106.06909","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-07T20:34:09.701797Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":"cs.SD","work_id":"d786d96c-26ba-4c99-a2e9-9da6984c3cb2","year":2021},"citing_paper":{"arxiv_id":"2607.05276","last_updated":"2026-07-06T16:21:34Z","snapshot_observed_at":"2026-08-02T01:15:17.727303Z","submitted_at":"2026-07-06T16:21:34Z","title":"ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-07T20:30:53.546267Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2607.05276"},"observation_digest":"sha256:d93b02cb05824a2af72f52b676b35e1246a7a47e2c0703a3a26dff9ad5677a63","observation_id":"a789fa27-f67e-4aab-abe5-b2853c6704ff","resolution":{"observed_at":"2026-07-07T20:34:09.705579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-01T07:12:17.158490Z","title":"arXiv preprint arXiv:2106.06909 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.158490Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:63239577c5ded3013017cd847144be4d64c432e5d7d026e7b079b48a1732ffa0","observation_id":"ea645a66-611d-4f17-8f19-4fe61d3755fd","resolution":{"observed_at":"2026-08-01T07:12:17.158490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-07-31T10:28:23.121360Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28351","last_updated":"2026-08-14T11:35:03Z","snapshot_observed_at":"2026-08-18T00:09:30.565398Z","submitted_at":"2026-07-30T15:21:38Z","title":"Teffic-Audio: Tell Fact from Fiction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T10:28:23.121360Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2607.28351"},"observation_digest":"sha256:fda7fd1cc81bdd32d2cbdab3b9d35ccef31d03441764774ff6c42128bd7febf2","observation_id":"4ec5937e-80d3-493e-a287-688527d91673","resolution":{"observed_at":"2026-07-31T10:28:23.121360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-04T16:29:18.068131Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:18.068131Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:794462d6e5016a5030c5f82d14f09eef4c503bf6bd110b23b2546e8f82b050f7","observation_id":"419dafd1-6ce6-42e6-b268-393854088f08","resolution":{"observed_at":"2026-08-04T16:29:18.068131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T00:14:41.762978Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:41.762978Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:9624f429e37cec1d3919ae5d1ef1b3cb0da8267f7ed7cf5548dc5195bea18982","observation_id":"b8863186-fa0b-4565-b00b-518392991fb4","resolution":{"observed_at":"2026-08-07T00:14:41.762978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-10T04:29:50.734798Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06424","last_updated":"2026-08-05T18:57:34Z","snapshot_observed_at":"2026-08-14T22:10:01.793265Z","submitted_at":"2026-08-05T18:57:34Z","title":"Multi Codec Discrete Diffusion Model for Text Guided Speech Inpainting and Editing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:50.734798Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.06424"},"observation_digest":"sha256:779210ad5b3c1943c051841e7c63feaddacc0b35f67a81f67cf9a421f920118d","observation_id":"a755dd70-14c7-4da9-a1b6-0ed318841856","resolution":{"observed_at":"2026-08-10T04:29:50.734798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-12T00:10:40.898571Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08362","last_updated":"2026-08-08T23:17:09Z","snapshot_observed_at":"2026-08-16T10:49:28.298101Z","submitted_at":"2026-08-08T23:17:09Z","title":"CtrlSpeech: Coarse-to-Fine Control for Expressive Speech Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:10:40.898571Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.08362"},"observation_digest":"sha256:6156c8a109fc2ceefcf171bb78ee3ca6dc99f3741017c0a2e774d58a2eb9f5e2","observation_id":"d8b16eb8-10f0-4ab0-b52d-b78e3a58f35a","resolution":{"observed_at":"2026-08-12T00:10:40.898571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-12T16:29:58.817680Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10836","last_updated":"2026-08-11T12:02:55Z","snapshot_observed_at":"2026-08-16T02:50:13.025099Z","submitted_at":"2026-08-11T12:02:55Z","title":"Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:29:58.817680Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.10836"},"observation_digest":"sha256:222cb3f8bcb8977cbc03007445775f558aa05241d37cb49ce307572b60829f71","observation_id":"ad93df12-96db-4d22-8d52-56e995c2a678","resolution":{"observed_at":"2026-08-12T16:29:58.817680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-12T15:11:43.708566Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-17T22:54:14.597493Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.708566Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:b7e38b521df17adaca3eaa67b8af445226974c2fd716b991f3ea7d1c9ee1ca8d","observation_id":"d21430d1-f07b-4d58-b5af-fc516e071a1f","resolution":{"observed_at":"2026-08-12T15:11:43.708566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-16T00:37:04.864550Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-17T06:24:31.725436Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.864550Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:10aa8bd4de2aa385bab46ccb597ca6c352991fe2545419fb83c04e518b394636","observation_id":"ef19d6b0-298f-446a-838c-2426a92e094b","resolution":{"observed_at":"2026-08-16T00:37:04.864550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2106.06909/citation-record","integrity":"/paper/2106.06909/integrity","json":"/paper/2106.06909/citation-record.json","paper":"/paper/2106.06909"},"outbound":[],"paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 72 inbound Pith citation observations for arXiv:2106.06909."}