{"as_of":"2026-08-11T08:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d3da93654547b6bf353f15a651eaec2fc8ffc010df1f166c739f5d805b87a0c","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:15:28.530654Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09104/citation-record","integrity":"/paper/2501.09104/integrity","json":"/paper/2501.09104/citation-record.json","paper":"/paper/2501.09104"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.153598Z","title":"Almost unsupervised text to speech and automatic speech recognition,","venue":null,"work_id":"91f46ad1-1cc6-4f3e-9f6b-38ffae7b5fab","year":2019},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.346059Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:5274b49e9e2dc24469b5f0667b3a89eb2a5d4862f990b537e2b34e57f8322245","observation_id":"19382c3b-43d4-4f07-a5f9-f554ba6d7e2f","resolution":{"observed_at":"2026-08-10T20:15:29.158504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.138119Z","title":"Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing,","venue":null,"work_id":"9b154bcd-48cd-42d7-9964-64cab9dafa46","year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.351495Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:e06dc2426138cc5f6e55f5b9ef050a9b7179caecbb273d40d1ec21f6ae2f9530","observation_id":"1cbe7a3b-e633-4f52-b960-bb91073d34ee","resolution":{"observed_at":"2026-08-10T20:15:29.143256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-10T13:50:38.422341Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-10T20:15:28.356241Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.356241Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:d4d1341567c24044bc2c8563a6e6ddba964553f49f249db1dc7fcdda65e93b07","observation_id":"ce8b6928-7725-4f9a-ad72-f4fcab158215","resolution":{"observed_at":"2026-08-10T20:15:28.356241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-10T20:15:28.361491Z","title":"Seamlessm4t-massively multilingual & multimodal machine translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.361491Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:1dc138ddd2fd130146233b50ab549109f5dcfb6c49ac69dd14378633c410ec4c","observation_id":"e745e0e5-a8ee-4a6a-bcf3-0b8162d14bab","resolution":{"observed_at":"2026-08-10T20:15:28.361491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-10T20:15:28.366374Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.366374Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:df57e543294dac079b44096ab09ec6c1e25eb04e3502cfb7e46df8cfb27a9067","observation_id":"986c61e3-f5ce-4887-9e99-81673de043b5","resolution":{"observed_at":"2026-08-10T20:15:28.366374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.122449Z","title":"Viola: Conditional language models for speech recognition, synthesis, and translation,","venue":null,"work_id":"8477ce4c-1186-47c4-a0f8-615d5d88e53e","year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.371562Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:3d1b7ac734faac9ae387fb309ca55f455b2718de22df84d0a3e2836dcc02ca64","observation_id":"5070c066-6467-47c6-9d22-90b4fb84ef2b","resolution":{"observed_at":"2026-08-10T20:15:29.127478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-10T20:15:28.376868Z","title":"Funaudiollm: V oice understanding and generation foundation models for natural interaction between humans and llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.376868Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:9a7d6bf0262caf1d654e19434bf332c4d75427b2a2d4b0e85528693fb0b86339","observation_id":"210853eb-d742-4853-9626-2bc877e506f7","resolution":{"observed_at":"2026-08-10T20:15:28.376868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12654","last_updated":"2024-08-27T02:22:00Z","snapshot_observed_at":"2026-08-10T14:42:44.718476Z","submitted_at":"2024-02-20T02:04:38Z","title":"OWSM-CTC: An Open Encoder-Only Speech Foundation Model for Speech Recognition, Translation, and Language Identification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12654","snapshot_observed_at":"2026-08-10T20:15:28.381704Z","title":"Owsm-ctc: An open encoder-only speech foundation model for speech recognition, translation, and language identification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.381704Z"},"links":{"cited_paper":"/paper/2402.12654","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:fbbd0bd4c555f518a530ce1cf3343cf9f27cfc17747a0869abe5a3d5622741e0","observation_id":"e92e1ccd-e614-476f-b7f5-bd0aca3b7af6","resolution":{"observed_at":"2026-08-10T20:15:28.381704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.387144Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.387144Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:4aa4b8e667de3f95daa83139d051cc8b6dbb563845d307482c93be96e8e0b36f","observation_id":"e185ac2e-fefd-4400-94fb-57479b7a0087","resolution":{"observed_at":"2026-08-10T20:15:28.387144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.391635Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.391635Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:269e80f86aafb2c26453a5d41096763611fbf99c0673625fb086555f0b67abc8","observation_id":"9d7e56b1-3251-4f64-8795-59b5b151f0e1","resolution":{"observed_at":"2026-08-10T20:15:28.391635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.084861Z","title":"Joist: A joint speech and text streaming model for asr,","venue":null,"work_id":"027b19ce-4ecf-42d4-817c-f67e988042ef","year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.396298Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:36e90939bd94d909a680b43d9ab327cb2965f74d006876bef862d4757b0f60b1","observation_id":"9135e5b5-2be5-4f6a-9626-61a1d0b3309e","resolution":{"observed_at":"2026-08-10T20:15:29.090188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.069164Z","title":"Integrating text inputs for training and adapting rnn transducer asr models,","venue":null,"work_id":"c1729203-bef7-4402-8109-6c5ce4f4c06d","year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.401786Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:eca160c16f150d5273b9372edaa7248a54c79e478ed5254dad95e2b2364acb42","observation_id":"f8c5f476-a811-4f5a-a647-fdfd02816f7a","resolution":{"observed_at":"2026-08-10T20:15:29.074509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.051805Z","title":"Semi-autoregressive streaming asr with label context,","venue":null,"work_id":"b0856e2f-a089-4d03-ac84-6ffc97b5ba51","year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.406510Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:f6584259108454cc4d6862e6d29e6074e625c67d7b653e849a44c9e92bf8265e","observation_id":"3c595c02-b884-4bc0-8e2e-5249f72347bb","resolution":{"observed_at":"2026-08-10T20:15:29.057689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14233","last_updated":"2020-10-24T09:35:37Z","snapshot_observed_at":"2026-07-06T10:08:59.640325Z","submitted_at":"2020-10-24T09:35:37Z","title":"Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment","version":1},"cited_work":{"arxiv_id":"2010.14233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.14233","snapshot_observed_at":"2026-08-10T20:15:28.755431Z","title":"Align-Refine: Non-Autoregressive Speech Recognition via Iterative Realignment","venue":"eess.AS","work_id":"539e0ffd-3c2b-48a7-8031-383a43b65548","year":2020},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.411135Z"},"links":{"cited_paper":"/paper/2010.14233","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:2d23e434c5d12358c45be0f413edfbbb8f42fa72b72a441ba71a4972cc67b7b5","observation_id":"c82be303-93f6-488a-b8f6-e55b71a57ae6","resolution":{"observed_at":"2026-08-10T20:15:28.760841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08700","last_updated":"2020-08-17T09:15:58Z","snapshot_observed_at":"2026-08-05T12:34:29.435807Z","submitted_at":"2020-05-18T13:30:16Z","title":"Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict","version":2},"cited_work":{"arxiv_id":"2005.08700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.08700","snapshot_observed_at":"2026-08-10T20:15:28.733360Z","title":"Mask CTC: Non-Autoregressive End-to-End ASR with CTC and Mask Predict","venue":"eess.AS","work_id":"14b09c14-0623-4cbe-8b1f-f9d36f524250","year":2020},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.416162Z"},"links":{"cited_paper":"/paper/2005.08700","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:caea363b2d59c1ef704fc74cf46c94e1ed59c9ac0b6ec49af314a0452ff1fe6d","observation_id":"6d57ffeb-8354-48c8-b6a0-a6e84ac19d02","resolution":{"observed_at":"2026-08-10T20:15:28.738910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16663","last_updated":"2023-04-20T01:23:54Z","snapshot_observed_at":"2026-08-07T01:30:35.655105Z","submitted_at":"2022-10-29T18:19:44Z","title":"BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model","version":2},"cited_work":{"arxiv_id":"2210.16663","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.16663","snapshot_observed_at":"2026-08-10T20:15:28.708245Z","title":"BERT Meets CTC: New Formulation of End-to-End Speech Recognition with Pre-trained Masked Language Model","venue":"eess.AS","work_id":"85e2e335-0155-4348-8d3b-a0555a451436","year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.421118Z"},"links":{"cited_paper":"/paper/2210.16663","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:18f645cf802629081c9951dc801ac70e5615ea7b8590f2abc92d90e49aef7265","observation_id":"a5baa8fd-78f8-46dc-bc2c-7badce02f133","resolution":{"observed_at":"2026-08-10T20:15:28.715509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.035059Z","title":"Bectra: Transducer-based end-to-end asr with bert-enhanced encoder,","venue":null,"work_id":"6562ff5c-0016-4592-ac09-be197479e0f0","year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.426110Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:c061be3e2c5846b812ceb0a3ada23dccac52a5d274476b7dd223c4b22da8ee87","observation_id":"2e82dfc9-12b7-4d54-9ae0-f774b1688393","resolution":{"observed_at":"2026-08-10T20:15:29.040118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:29.016131Z","title":"Mask-conformer: Augmenting conformer with mask-predict decoder,","venue":null,"work_id":"2ae03ba7-d2d4-483e-a65f-c081f1b3eee0","year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.430810Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:57f4378f7db9bef0fc4981476bc0405d32b56b28b4f0be03ec4ee54681b5f119","observation_id":"52ffb3d8-360b-4cb8-bd8d-dddbaa6cada6","resolution":{"observed_at":"2026-08-10T20:15:29.022217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.435399Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.435399Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:e7e535316152fb8ca1822af903a2ac919923b06316e32941bd61792fd39937ba","observation_id":"5e40e57e-16cc-46c1-93a4-c962b429327d","resolution":{"observed_at":"2026-08-10T20:15:28.435399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.440501Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.440501Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:75f6b16e86bb6e05981fc6c10bd15c076fbf90cf743924791d1f0a575a775ab7","observation_id":"afc07b86-e777-44ab-b611-e14c315d9f89","resolution":{"observed_at":"2026-08-10T20:15:28.440501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-10T20:15:28.445462Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.445462Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:269c1d3dc735e596e3b1fc0d8bafe38fae3e4d78a0ab0349639a744dab5c74a0","observation_id":"7279e4c5-b81f-4fdb-b014-702de35ec5c3","resolution":{"observed_at":"2026-08-10T20:15:28.445462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.450541Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.450541Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:f574f169961d3e4c064a003720b917e66049739c8504fd42516759e2d78f225b","observation_id":"3d529b1a-5af5-4d0c-a21c-e91333cc6ae9","resolution":{"observed_at":"2026-08-10T20:15:28.450541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17230","last_updated":"2024-06-13T05:19:12Z","snapshot_observed_at":"2026-07-06T17:22:37.193255Z","submitted_at":"2024-01-30T18:18:27Z","title":"ESPnet-SPK: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17230","snapshot_observed_at":"2026-08-10T20:15:28.455695Z","title":"Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.455695Z"},"links":{"cited_paper":"/paper/2401.17230","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:d8dc62dda2bd4c486f5a5d37ea8c385165ebb6c59323a32650eff13ce88f4a81","observation_id":"82b3c130-1de6-46c1-aa51-3fb9b5a1f987","resolution":{"observed_at":"2026-08-10T20:15:28.455695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.962434Z","title":"The lj speech dataset,","venue":null,"work_id":"4c54974f-0ea1-4f69-a0a7-bda75539f018","year":2017},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.460414Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:350869582e413f75fe91f692c07a235830966dacc61ea254270de2ed06f89b8f","observation_id":"96cce75b-7029-453f-9f93-4549ae9cf4fe","resolution":{"observed_at":"2026-08-10T20:15:28.967736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-10T09:39:47.608323Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-10T20:15:28.464814Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.464814Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:1255a5d8f41967e386a7b7e0cda5fa12f6b35f588f2c44628ce35c964cb669fe","observation_id":"348305b0-a045-4aff-8f80-e15c448bc940","resolution":{"observed_at":"2026-08-10T20:15:28.464814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.469522Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.469522Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:227399530034cf5b30e3083f1c054ed671877d36a651e3692f837b2bcb2dcc02","observation_id":"442bc79f-1de7-4d20-913a-e655ee78199b","resolution":{"observed_at":"2026-08-10T20:15:28.469522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18802","last_updated":"2023-05-30T07:30:21Z","snapshot_observed_at":"2026-08-10T04:18:28.247428Z","submitted_at":"2023-05-30T07:30:21Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18802","snapshot_observed_at":"2026-08-10T20:15:28.474447Z","title":"Libritts-r: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.474447Z"},"links":{"cited_paper":"/paper/2305.18802","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:d382c4060502ba53fb328569a5b530961b114c90d8c5c5c1739bce100b884225","observation_id":"7a0bd6be-8bba-440d-92d7-eeb78616a12b","resolution":{"observed_at":"2026-08-10T20:15:28.474447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-10T20:15:28.480440Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.480440Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:3bbfcf822670639248d72e09781363ce082c7e1585cb3da7f058926e316a42c8","observation_id":"dba533ba-213b-44b6-b407-465ed4750d52","resolution":{"observed_at":"2026-08-10T20:15:28.480440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-10T20:15:28.485951Z","title":"Ecapa-tdnn: Em- phasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.485951Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:c2354302172f3af440b658d75f3652936f630ec161fd23a29c29ed09b9e71ddf","observation_id":"18d15006-6a65-46be-87ac-9ce3b30c07ba","resolution":{"observed_at":"2026-08-10T20:15:28.485951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.491768Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.491768Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:b5118bfb7dbad53a3d1592bbf029229cbee8c4e5c7c4e7584063bc539d0b82ab","observation_id":"60d7cb1f-ff83-4449-a370-e8cf45f47c44","resolution":{"observed_at":"2026-08-10T20:15:28.491768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08779","last_updated":"2019-12-03T18:19:07Z","snapshot_observed_at":"2026-08-09T05:21:08.018150Z","submitted_at":"2019-04-18T17:53:38Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08779","snapshot_observed_at":"2026-08-10T20:15:28.496296Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.496296Z"},"links":{"cited_paper":"/paper/1904.08779","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:72e8984f44eb37a4a819f57464c8af676aec59072f0ab3f1a4f0ca58b4818da8","observation_id":"7701a5c4-ff0c-4c81-bba2-b716a10662c7","resolution":{"observed_at":"2026-08-10T20:15:28.496296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.500917Z","title":"Audio augmentation for speech recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.500917Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:6a25a140092c40890af7fc4600e68b5b8b8680cf5572e55d0fd0853e299a030b","observation_id":"580a110f-fe7f-4fd9-9ad7-f31e81b52e7c","resolution":{"observed_at":"2026-08-10T20:15:28.500917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.506312Z","title":"Super-convergence: Very fast training of neural networks using large learning rates,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.506312Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:1d6e19a880bea13cd226c83c52fd5b9afa1c4d11c403a2db5f4b76346664329a","observation_id":"a30e41ff-9fd7-4bbd-a147-5d29be044c01","resolution":{"observed_at":"2026-08-10T20:15:28.506312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.510887Z","title":"Rethinking the inception architecture for computer vision,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.510887Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:5d45a344f3785e5eee0caf7e7a4a11a3816c28c15c7be566ff5cd0fd5223ee69","observation_id":"d0fdf2ab-b8e7-4cb6-b0e6-66a6fa579f6f","resolution":{"observed_at":"2026-08-10T20:15:28.510887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.885888Z","title":"Regularization of neural networks using dropconnect,","venue":null,"work_id":"a971f123-f251-4bd8-be5a-7fe00779c6ef","year":2013},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.516216Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:1460664479011098224254749abdce03cc904fccd5d4478d65cb75feef6d05c2","observation_id":"f4c980a6-9f46-484e-95ff-654787756f49","resolution":{"observed_at":"2026-08-10T20:15:28.891532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:28.868003Z","title":"Sequence noise injected training for end-to-end speech recognition,","venue":null,"work_id":"3b3795fb-f407-4fc9-824d-e1d64f972143","year":2019},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.520889Z"},"links":{"citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:8240e8f2996c99c999008e0c96ab001ec4db78a896c3975c939a2bc602e1c7ab","observation_id":"004df12f-cf94-43a1-b93f-989747bbc029","resolution":{"observed_at":"2026-08-10T20:15:28.873661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02724","last_updated":"2021-10-08T10:00:43Z","snapshot_observed_at":"2026-08-09T23:10:26.622933Z","submitted_at":"2021-04-06T18:00:03Z","title":"Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02724","snapshot_observed_at":"2026-08-10T20:15:28.525732Z","title":"Relaxing the conditional independence assumption of ctc-based asr by conditioning on intermediate predictions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.525732Z"},"links":{"cited_paper":"/paper/2104.02724","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:3901d5ae20f98912636c10103ec388213af9e168587fd904f277a67e27dde6a5","observation_id":"9a06238f-8bab-4481-971b-91cb02c8bc78","resolution":{"observed_at":"2026-08-10T20:15:28.525732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-10T20:15:28.530654Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:28.530654Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2501.09104"},"observation_digest":"sha256:c5129dbff5e3aced6d54565f6e19a08297217d3b225e958d7d830aef719ed794","observation_id":"25f1d255-6d72-4087-87ff-f4a4ff22e5fa","resolution":{"observed_at":"2026-08-10T20:15:28.530654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.09104","last_updated":"2025-01-20T18:35:40Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T20:08:04.494742Z","submitted_at":"2025-01-15T19:42:41Z","title":"A Non-autoregressive Model for Joint STT and TTS"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":3,"verified_fuzzy":11},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2501.09104."}