{"as_of":"2026-08-08T07:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7350960ec75034c036414c20639aad889732ea6fee70f76d369074fb8234a446","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:16.151902Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":14,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-12T08:13:21.962488Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2410.00037"},"observation_digest":"sha256:ec3fd8ae1ba2d4aaf494d027f856efc377f9117f0725a3abb78196e3a33232f7","observation_id":"e4360b2b-7a9d-4c88-ab5f-5dff3bc5fc37","resolution":{"observed_at":"2026-05-12T08:13:22.565669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:e1e846c971f8a40aad489e93c9e82cc63f45aa14b832267eee13f8f59c87e781","observation_id":"0c1be9db-808d-43b2-8d74-453dc411fda3","resolution":{"observed_at":"2026-05-11T19:21:27.112262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T15:23:16.151902Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.151902Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:d11b2be02bb5146234e2e13034adadbce59afeed19c8fcbbc4452c2d8e5f1f09","observation_id":"6c5afbac-e9d2-4862-8f5f-cab96a22e33d","resolution":{"observed_at":"2026-08-07T15:23:16.151902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T13:21:08.829562Z","title":"UniAudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.829562Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:e3be8ac2f9a478b00f9ae265387bbd2b509c8411e2af5b355121471923f02efc","observation_id":"48e7124c-05e4-43c9-bb0d-10ed4f8b5f88","resolution":{"observed_at":"2026-08-07T13:21:08.829562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T11:59:49.805442Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00927","last_updated":"2025-06-01T09:41:56Z","snapshot_observed_at":"2026-08-07T11:52:21.029687Z","submitted_at":"2025-06-01T09:41:56Z","title":"In-the-wild Audio Spatialization with Flexible Text-guided Localization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:49.805442Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.00927"},"observation_digest":"sha256:8507ecde220da12237ed486ee5afdf4cd6476536833af00e1d83c2e3aeb4d680","observation_id":"c87ec37f-a114-40b6-acff-57d356b935c6","resolution":{"observed_at":"2026-08-07T11:59:49.805442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T11:57:58.032031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.032031Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:ab1b8017520096a17004ae63c3edc0f0aaa157fa5509be85270c52898a0e5247","observation_id":"4eb02c9c-0049-4412-b20a-1d0f0b385f28","resolution":{"observed_at":"2026-08-07T11:57:58.032031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T11:54:24.284181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01111","last_updated":"2025-06-01T18:29:17Z","snapshot_observed_at":"2026-08-07T11:48:17.343481Z","submitted_at":"2025-06-01T18:29:17Z","title":"FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.284181Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.01111"},"observation_digest":"sha256:ab65f3a49e69043cd5c0a4edcaa5339ebebc3daf6b9a4ff593bd6877d65fbdc4","observation_id":"93b38794-9dc5-4c3f-b4e9-219efef4dac9","resolution":{"observed_at":"2026-08-07T11:54:24.284181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T05:33:55.754374Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07647","last_updated":"2025-06-09T11:12:02Z","snapshot_observed_at":"2026-08-07T22:34:01.355447Z","submitted_at":"2025-06-09T11:12:02Z","title":"Foundation Model Empowered Synesthesia of Machines (SoM): AI-native Intelligent Multi-Modal Sensing-Communication Integration","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:55.754374Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.07647"},"observation_digest":"sha256:4ca2e3adc0a2526d9f1626578f38b525b3d0268e6fb36c3c41f7156ce4839261","observation_id":"e9596670-4fda-4713-bc55-68aeb0e506e2","resolution":{"observed_at":"2026-08-07T05:33:55.754374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T05:23:32.781421Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08228","last_updated":"2025-09-08T00:53:59Z","snapshot_observed_at":"2026-08-07T05:14:41.319930Z","submitted_at":"2025-06-09T20:54:23Z","title":"Scaling Laws of Motion Forecasting and Planning -- Technical Report","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:23:32.781421Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.08228"},"observation_digest":"sha256:ddbe3a4e73563fb6ce4392c9816e335d452171ab0f7b4dd337dc25ef015f45d8","observation_id":"4572b879-d5a4-4980-9e0d-41350217fb08","resolution":{"observed_at":"2026-08-07T05:23:32.781421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T19:02:24.387244Z","title":"Uniaudio: An audio foundation model toward universal audio gener- ation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06674","last_updated":"2025-07-09T09:05:18Z","snapshot_observed_at":"2026-08-07T17:54:54.429577Z","submitted_at":"2025-07-09T09:05:18Z","title":"Exploring State-Space-Model based Language Model in Music Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:02:24.387244Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.06674"},"observation_digest":"sha256:8d5180d81d8ee318c2af04371db93ee528297a454fc27067229717915812a4fc","observation_id":"981006d2-d1a6-4647-8332-b80cd2f36eda","resolution":{"observed_at":"2026-08-06T19:02:24.387244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T18:14:07.244165Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09070","last_updated":"2025-07-11T23:14:07Z","snapshot_observed_at":"2026-08-07T03:22:32.050442Z","submitted_at":"2025-07-11T23:14:07Z","title":"SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:07.244165Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.09070"},"observation_digest":"sha256:44923b482e1671fd0c99fc9229d8709557bceb6b43bcd9cf4fd848109e8a17e9","observation_id":"72949c76-f247-4187-949e-bf301ca95cc7","resolution":{"observed_at":"2026-08-06T18:14:07.244165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T17:52:01.524187Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-08T06:06:03.408925Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.524187Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:acde31c19f4af2fe64ee375073d4b15b64e22b80fa30bf1b8e1d9b718cb10546","observation_id":"d682d2a4-1638-47e1-b3b7-c04993354b10","resolution":{"observed_at":"2026-08-06T17:52:01.524187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T17:46:18.500277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.500277Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:45f1fe961c9324d96207140eadf9b79a22bb751c254e9adf52f2822b20127556","observation_id":"c6e79082-fc53-44c9-8f1e-6ec750618d11","resolution":{"observed_at":"2026-08-06T17:46:18.500277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T17:05:28.943831Z","title":"UniAudio: An audio foundation model toward universal audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11773","last_updated":"2025-07-15T22:24:17Z","snapshot_observed_at":"2026-08-06T16:59:35.999059Z","submitted_at":"2025-07-15T22:24:17Z","title":"Small Data Explainer -- The impact of small data methods in everyday life","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T17:05:28.943831Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.11773"},"observation_digest":"sha256:662fddb50c776a846235b53da14a1e6fc5b588a8e605f63f5bb107ae99b4da33","observation_id":"118c0019-ded0-417d-97e5-48b2b48b530c","resolution":{"observed_at":"2026-08-06T17:05:28.943831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T16:55:50.479314Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-07T14:59:35.759272Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:50.479314Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:e7b8593e07ee43f4a579bebe7ad5f1c6df4c131dce61375777336ee83b2559e5","observation_id":"506e6954-1a24-43c5-aaa2-a2c3c992b00e","resolution":{"observed_at":"2026-08-06T16:55:50.479314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T14:50:04.199707Z","title":"ArXiv abs/2310.00704 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.199707Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:4b233c2c876b20fb99f6ca39095302d5a51420925d2933e464cad651c38b4462","observation_id":"8ff6b37b-4359-4374-8562-1d9f47b94cca","resolution":{"observed_at":"2026-08-06T14:50:04.199707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T10:59:05.807002Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23267","last_updated":"2025-07-31T05:56:21Z","snapshot_observed_at":"2026-08-08T06:45:29.874472Z","submitted_at":"2025-07-31T05:56:21Z","title":"Your Spending Needs Attention: Modeling Financial Habits with Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:59:05.807002Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.23267"},"observation_digest":"sha256:b072d8515222ba0b5e57be73f6d9d95692f989223b254e35b5a067c24f7a21bd","observation_id":"ecd473e6-b5a8-42f0-9157-10e01aae665a","resolution":{"observed_at":"2026-08-06T10:59:05.807002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T15:29:25.573605Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19852","last_updated":"2025-08-28T07:08:03Z","snapshot_observed_at":"2026-08-07T08:18:37.593830Z","submitted_at":"2025-08-27T13:09:55Z","title":"Ego-centric Predictive Model Conditioned on Hand Trajectories","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T15:29:25.573605Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2508.19852"},"observation_digest":"sha256:1ede15c71e51786bade8d982f24544b0020b3bdf12b0f4721e66c9155664a215","observation_id":"404acb60-0c1c-40f7-93ad-3c6b2d3cc334","resolution":{"observed_at":"2026-08-05T15:29:25.573605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-07T01:53:38.136292Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:9499003ac5afff2d1565efd50d30788976968644bfdb28e3f6f85d7db6b89c35","observation_id":"e6197b20-9dbe-4590-945c-9a1418149def","resolution":{"observed_at":"2026-05-21T22:24:23.543438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T11:29:36.870189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:36.870189Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:c32d998440267e927843956555e1e1a61f75b787b03efdee3e7b72848b2f7f69","observation_id":"a6ccd059-323c-4831-b26c-401f61f95b9c","resolution":{"observed_at":"2026-08-04T11:29:36.870189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T07:42:43.077644Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:f81abae0db864937a2bcc2fce714d1f7eca96e96bf51d4fa3f961e6e341dc34a","observation_id":"7c4c84d1-c061-4e10-a641-3c466918b1cd","resolution":{"observed_at":"2026-05-18T07:46:03.644203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T20:56:37.533183Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:69413a7e983527e00f0e56915c674ecd10d494f54d8e25d988616c8a6483cec4","observation_id":"cefc0374-dafb-439b-9a9f-a548839f2bdf","resolution":{"observed_at":"2026-05-21T21:00:39.106539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T09:49:42.653482Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T09:49:42.653482Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:2aa47a0e0b5644814382d773b02f93cae180ea263854958ebf5d30e7225a22f5","observation_id":"b07c37f9-d40f-46f2-91cb-41d3251b0bbc","resolution":{"observed_at":"2026-08-04T09:49:42.653482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T06:47:10.473180Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation.arXiv preprint arXiv:2310.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-08T05:22:59.737639Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:10.473180Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:e013ed8bb4c355d82135150d1c1c7c2a8f7dd8e0a4a6d03d56b6e1718dc943ab","observation_id":"3fb4263e-3399-4e4f-b0ee-b933c3288000","resolution":{"observed_at":"2026-08-04T06:47:10.473180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:6bb860d77484360f7089d763a5f563e29f9830468bb792c115db4c72a50e0ac9","observation_id":"c6f8bd97-d23e-4c84-ae04-9a6fff638289","resolution":{"observed_at":"2026-05-16T19:24:56.178157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-03T06:03:33.272230Z","title":"Uniaudio: An audio foundation model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00560","last_updated":"2026-06-10T10:57:05Z","snapshot_observed_at":"2026-08-07T06:26:40.381217Z","submitted_at":"2026-01-31T06:56:50Z","title":"Edit Content, Preserve Acoustics: Imperceptible Text-Based Speech Editing via Self-Consistency Rewards","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:03:33.272230Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2602.00560"},"observation_digest":"sha256:50b6f5306d394015d4f2aeeb4390b6f6cfa3db80bf1710e489d72db1227762be","observation_id":"bbcbef27-93d7-41b0-986d-1c53182bed16","resolution":{"observed_at":"2026-08-03T06:03:33.272230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-03T00:57:01.237575Z","title":"findings-acl.828/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.11072","last_updated":"2026-07-22T13:29:14Z","snapshot_observed_at":"2026-08-06T14:37:34.263838Z","submitted_at":"2026-02-11T17:41:01Z","title":"Simultaneous Speech-to-Speech Translation Without Aligned Data","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T00:57:01.237575Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2602.11072"},"observation_digest":"sha256:7384f895a79cef12438b375b44e70ed05492b9b9cafad07d58e5fc3fd55f1aa0","observation_id":"71031306-d505-4e03-98b8-542f9d4370e0","resolution":{"observed_at":"2026-08-03T00:57:01.237575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-02T20:00:06.136667Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00395","last_updated":"2026-07-10T08:34:01Z","snapshot_observed_at":"2026-08-05T12:26:35.153359Z","submitted_at":"2026-02-28T00:50:00Z","title":"Fine-grained Soundscape Control for Augmented Hearing","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T20:00:06.136667Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2603.00395"},"observation_digest":"sha256:2f02a9b734097daa63d76973afa6a3ee506ad97a86a866481f5e1aee31273ef2","observation_id":"0f88f706-4546-4784-8303-9f521e2f6234","resolution":{"observed_at":"2026-08-02T20:00:06.136667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2605.09259","last_updated":"2026-05-10T02:08:07Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:08:07Z","title":"Remix the Timbre: Diffusion-Based Style Transfer Across Polyphonic Stems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:58:26.634355Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2605.09259"},"observation_digest":"sha256:251216bbb0622a62b532b69f6f0e8d6ba19653ff608da70a439d52f993a19b3d","observation_id":"1f131168-718f-4581-ae3f-3eab37b2d5eb","resolution":{"observed_at":"2026-05-12T05:46:27.928071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2605.15831","last_updated":"2026-05-15T10:35:49Z","snapshot_observed_at":"2026-07-06T23:27:05.961780Z","submitted_at":"2026-05-15T10:35:49Z","title":"Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T18:47:32.003545Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2605.15831"},"observation_digest":"sha256:b0c367bb97fa9e02ddb87e17e67f8500b8d6d7c4f0528e2ae2090aeb00f21b2c","observation_id":"c0fb6750-12f8-47aa-b72c-659f602c332e","resolution":{"observed_at":"2026-05-19T18:47:43.034952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2605.28063","last_updated":"2026-05-27T07:15:35Z","snapshot_observed_at":"2026-08-06T20:35:40.532245Z","submitted_at":"2026-05-27T07:15:35Z","title":"Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T10:28:18.202974Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2605.28063"},"observation_digest":"sha256:323567b21a094623ab8450496c43ce56a534791717533a76f1841cdec6bc9ddd","observation_id":"e2101993-a06f-4051-818d-136ce8d283bc","resolution":{"observed_at":"2026-06-29T10:33:17.934369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-01T15:52:02.822088Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:ed49296430e519ce1feb67bbefa5ad72e3faa47a02e1ee2e6930f6f12cc6df67","observation_id":"323b2215-b214-4cd6-a90a-ff2a2dc5a7c7","resolution":{"observed_at":"2026-07-02T00:46:24.586510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:f1d9e0ee2be2c689cf0cfba5b110d1c253db10ac079ecbb392d355287af8bc68","observation_id":"3f22033f-a2cb-4491-8224-66d7c5fdcebc","resolution":{"observed_at":"2026-07-03T16:08:37.522604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2606.21372","last_updated":"2026-06-19T12:24:49Z","snapshot_observed_at":"2026-08-01T15:59:11.712537Z","submitted_at":"2026-06-19T12:24:49Z","title":"NAC: Neural Action Codec for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T13:59:53.484305Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2606.21372"},"observation_digest":"sha256:806afe08602dc4696155a2d7e4e401079c92495aaa5d6d2031dce9e6e0f59f48","observation_id":"7746aa85-7f8c-453c-b45b-f0bc2f686713","resolution":{"observed_at":"2026-07-04T06:59:37.873935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:1405365fdee1d8d8436c0116b010f6237263466dafc3f5cd8c5ab2ca5e2ede82","observation_id":"e05d13f6-79a7-4bf1-a267-e5cfad63baa1","resolution":{"observed_at":"2026-07-04T11:59:50.989373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":"2310.00704","doi":"10.48550/arxiv.2310.00704","metadata_source":"pith","pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation","venue":"cs.SD","work_id":"32877994-1a46-4754-bfc9-a1b6f56ead50","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:2d65fb1aaabc6494933138895f97152a147fa02f146638f671214f8ed8d2fddf","observation_id":"22c60912-0aec-4dea-9cd9-2e2be7da006e","resolution":{"observed_at":"2026-07-08T00:04:22.397390Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2310.00704 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:6da0c83e5674e20e725e41e4201a55f35eaaf2ba52bdaec3c99e49d313526fd8","observation_id":"59d0817a-b1a7-4eff-8df7-4707f059cc02","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-07-13T05:10:26.667731Z","title":"arXiv preprint arXiv:2310.00704 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09134","last_updated":"2026-07-10T06:44:04Z","snapshot_observed_at":"2026-08-07T15:40:45.553118Z","submitted_at":"2026-07-10T06:44:04Z","title":"ReGen: Hierarchical Multi-Prompt Representation Generation for Efficient Waveform Diffusion Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-13T05:10:26.667731Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.09134"},"observation_digest":"sha256:7d33cd544802f2ff4e57216b8788d61a390b76becd25072f63acac7effc52750","observation_id":"2aa98018-0654-4444-959f-a554c30ce503","resolution":{"observed_at":"2026-07-13T05:10:26.667731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-07-30T14:08:14.574038Z","title":"UniAudio: An audio foundation model toward universal audio generation.arXiv preprint arXiv:2310.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-30T14:08:14.574038Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:f0d35e419dc3becb6263ce5977fc1b99658675563a4125a01b061d1eba3e1cad","observation_id":"ba1e27fc-e26b-4c2d-8126-fa61f865c25f","resolution":{"observed_at":"2026-07-30T14:08:14.574038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-01T10:17:27.671246Z","title":"UniAudio: An audio foundation model toward universal audio generation.arXiv preprint arXiv:2310.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-04T22:37:07.722518Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:27.671246Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:f32be0ca8f1316b029c162004751ca9c9b67430efca654478b8d5809e04207ff","observation_id":"e8563ad7-2fc0-47f6-abc6-efa67a33c4ee","resolution":{"observed_at":"2026-08-01T10:17:27.671246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-04T16:29:30.088106Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:30.088106Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:70383d891c9bb5d81634ad64f98d6b05321deb9d8bdeb7a180b9d34bfec97d47","observation_id":"f6a686b1-0ac0-4803-9929-bcd8db3a2396","resolution":{"observed_at":"2026-08-04T16:29:30.088106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T00:14:49.016529Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-07T23:09:45.300110Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:49.016529Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:883d91b6273ff584bd65bbf705075d41090d3a15765b632a6c6983df600217e2","observation_id":"bcd2f08e-ee7f-4ed1-b3c2-e482f20237cf","resolution":{"observed_at":"2026-08-07T00:14:49.016529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.00704/citation-record","integrity":"/paper/2310.00704/integrity","json":"/paper/2310.00704/citation-record.json","paper":"/paper/2310.00704"},"outbound":[],"paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","latest_version":6,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2310.00704."}