{"as_of":"2026-08-07T09:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4f7a77e566a8cb603de33ffb5a86743b9d373d6e281b19439db2cd10cc1dad3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:58:07.862140Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:37:35.221767Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:385ec5bc5d4820ead2d3485b6bb082551a1befc0535667822a1823a496d16f9b","observation_id":"0847645e-1357-4457-be39-54962b7a6d8c","resolution":{"observed_at":"2026-05-16T06:06:41.461429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-07T04:58:07.862140Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation, 2024.https://arxiv.org/abs/2407.05361","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-07T04:48:13.328915Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:07.862140Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2506.09344"},"observation_digest":"sha256:868241c7e901ad42e67dde9cd9cbb88c9572a277c274c21090516ae2cb48e7a7","observation_id":"619ad11f-4d92-493b-ac30-edf1ab09139c","resolution":{"observed_at":"2026-08-07T04:58:07.862140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-06T21:33:09.346129Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23986","last_updated":"2025-07-01T16:23:28Z","snapshot_observed_at":"2026-08-06T21:24:38.665945Z","submitted_at":"2025-06-30T15:50:08Z","title":"StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:09.346129Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2506.23986"},"observation_digest":"sha256:5c3fdda851acbe9f79ef256ceb1c092655827caf2648291fc689d2318743bcf9","observation_id":"9984cf1e-8e2c-41fd-8878-4c2e019d5754","resolution":{"observed_at":"2026-08-06T21:33:09.346129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-06T16:33:52.444640Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13155","last_updated":"2025-07-17T14:17:40Z","snapshot_observed_at":"2026-08-06T16:26:45.969196Z","submitted_at":"2025-07-17T14:17:40Z","title":"NonverbalTTS: A Public English Corpus of Text-Aligned Nonverbal Vocalizations with Emotion Annotations for Text-to-Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:52.444640Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2507.13155"},"observation_digest":"sha256:ddd3e26b245e47221e7b487975282999294929e6c0e0b94fe2933bbaeb0b2554","observation_id":"89261381-9e78-4f79-bcef-a759ffdab20e","resolution":{"observed_at":"2026-08-06T16:33:52.444640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-06T12:36:16.250981Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21642","last_updated":"2025-08-25T08:17:22Z","snapshot_observed_at":"2026-08-06T12:36:14.281703Z","submitted_at":"2025-07-29T09:58:45Z","title":"Whilter: A Whisper-based Data Filter for \"In-the-Wild\" Speech Corpora Using Utterance-level Multi-Task Classification","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:36:16.250981Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2507.21642"},"observation_digest":"sha256:39ea3b7834e7302fbcd82bfc4ed61524004ae8a70072cc2e1562ed53aeebe3ab","observation_id":"d4a39cdd-a493-4d96-90f3-f2082407f8dd","resolution":{"observed_at":"2026-08-06T12:36:16.250981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-05T23:41:51.083471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04996","last_updated":"2025-08-08T01:59:26Z","snapshot_observed_at":"2026-08-05T23:41:48.793102Z","submitted_at":"2025-08-07T03:08:49Z","title":"REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:41:51.083471Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2508.04996"},"observation_digest":"sha256:114b2e82fce7ea35bbf21190a0c207632b04ffaa878ffd01b96599ade93612ab","observation_id":"2dd37568-2bd1-4ee7-bb30-6599b6d618ad","resolution":{"observed_at":"2026-08-05T23:41:51.083471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-05T11:41:00.064681Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02349","last_updated":"2025-09-04T14:25:57Z","snapshot_observed_at":"2026-08-05T11:40:56.040966Z","submitted_at":"2025-09-02T14:15:22Z","title":"AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:00.064681Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2509.02349"},"observation_digest":"sha256:86c305b977f8840a4647cd5ee1e4ddc297a5b4f8eb6303223cf642fdb90cf825","observation_id":"8d757418-74ce-4c4a-bd83-d8a955f0829b","resolution":{"observed_at":"2026-08-05T11:41:00.064681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-04T19:27:38.516808Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09296","last_updated":"2025-09-11T09:36:31Z","snapshot_observed_at":"2026-08-04T19:27:37.669061Z","submitted_at":"2025-09-11T09:36:31Z","title":"Over-the-Air Adversarial Attack Detection: from Datasets to Defenses","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:38.516808Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2509.09296"},"observation_digest":"sha256:254cd41ffd32efdb4ead55adcdeb05b9a56f26d6163da05d2ad5e7043d6b22b3","observation_id":"8623222a-d6e0-4eec-9ba4-f132b042c462","resolution":{"observed_at":"2026-08-04T19:27:38.516808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-04T11:29:32.656117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:32.656117Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:1a35c8097aaa0291f298a73d66500cc587f9f2a9951bc206cb1f9677be17f992","observation_id":"67778385-97e8-4920-b666-a32c0c30aee5","resolution":{"observed_at":"2026-08-04T11:29:32.656117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-02T18:03:42.435007Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-05T04:44:49.504243Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.435007Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:895d561aa61f1bc03b391e604f02218ef565a0ae1982cf6406838ce9a0812ceb","observation_id":"74e8b097-9b56-4718-84c0-761387fba4d7","resolution":{"observed_at":"2026-08-02T18:03:42.435007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:74a6d102be62ff6737cea5dcce26afcc81bfd034fad11af95eee78ac850a364f","observation_id":"608f90e4-bc54-4082-943e-6bf1fa17f6bf","resolution":{"observed_at":"2026-06-29T22:24:00.893750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2605.30748","last_updated":"2026-06-01T01:53:31Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T02:25:02Z","title":"Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T21:31:09.399885Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2605.30748"},"observation_digest":"sha256:9ce54c2cf8292b49a35186458d405818a74c3ec67566104ffc9089df4978153f","observation_id":"e34932ed-ecdb-42da-a5f3-21cdaa1d3d9f","resolution":{"observed_at":"2026-07-01T20:16:11.062977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2606.09048","last_updated":"2026-06-08T05:36:42Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T05:36:42Z","title":"BareWave: Waveform-Native Flow-Matching Text-to-Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T15:14:03.681833Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2606.09048"},"observation_digest":"sha256:81574125a73d13689b1608d39abd14e78074303cb80affce336e7195d716a3fb","observation_id":"d62537a3-9ff4-49c5-9a60-64ed195b9888","resolution":{"observed_at":"2026-07-03T03:37:35.223279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2606.10029","last_updated":"2026-06-08T18:09:37Z","snapshot_observed_at":"2026-08-06T14:10:31.952975Z","submitted_at":"2026-06-08T18:09:37Z","title":"Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T17:09:36.845217Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2606.10029"},"observation_digest":"sha256:f199845582c1463c6ffa23df8f5c33dd017de991a4fabbc1087b01757da7f03b","observation_id":"7de01159-c38e-444b-aa96-f909a7d722ed","resolution":{"observed_at":"2026-07-03T00:27:30.042911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":"2407.05361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-07-03T03:37:35.221767Z","title":"arXiv preprint arXiv:2407.05361 , year=","venue":null,"work_id":"1cf20033-c768-4fc5-bcdd-f566ab0b9231","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":170,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:e985249e1eccc5d9bc52f532846d875f55d8f52aceccb71e5eb7fd6d1a4b220e","observation_id":"1524d8be-3023-4edb-aeea-5ff6d095c286","resolution":{"observed_at":"2026-07-01T11:45:47.191378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-01T11:33:14.162197Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech gener- ation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19859","last_updated":"2026-07-22T07:48:37Z","snapshot_observed_at":"2026-08-04T15:26:57.843639Z","submitted_at":"2026-07-22T07:48:37Z","title":"StellarTTS: Sparse Temporal Embedding for Low-Latency and Robust Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:33:14.162197Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2607.19859"},"observation_digest":"sha256:6bb5d71ee46fa5e676e70acf76142fb98f57516780c0eb346bda959e0544592b","observation_id":"dcfe1bb0-7916-43a6-ad3b-06d4a79bf3d3","resolution":{"observed_at":"2026-08-01T11:33:14.162197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-01T08:25:28.128920Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21132","last_updated":"2026-07-23T10:12:36Z","snapshot_observed_at":"2026-08-06T20:43:47.837332Z","submitted_at":"2026-07-23T10:12:36Z","title":"Investigating Codec-Internal Latent Audio Watermarking for Neural Codec Robustness","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T08:25:28.128920Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2607.21132"},"observation_digest":"sha256:8d1aa0f20a6fb5a0658ab7e21ca30a7c31860744d06ce6e09cc0e91632275848","observation_id":"5cca810b-9b01-4a15-9bcd-fb0ddc527fdc","resolution":{"observed_at":"2026-08-01T08:25:28.128920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-04T02:47:37.291105Z","title":"Emilia: An extensive, multi- lingual, and diverse speech dataset for large-scale speech genera- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-06T23:11:30.635520Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.291105Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:7a8dfb66896e5a5e363cfa831b837bbacbc09eb8cf591e94f8ea468baaa7e90f","observation_id":"552f8c7f-7728-4854-8caa-0392f27ae99d","resolution":{"observed_at":"2026-08-04T02:47:37.291105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.05361/citation-record","integrity":"/paper/2407.05361/integrity","json":"/paper/2407.05361/citation-record.json","paper":"/paper/2407.05361"},"outbound":[],"paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2407.05361."}