{"as_of":"2026-08-10T20:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:551cb4e7ffe7e0f412c01ac966934636299402d24ba8e455c3766d75b8ba0f06","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":50,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:21:56.979989Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:380643a6250b14e00a9198d44f2508efc7667eeced2917bf8ddb9cbbf7bfa903","observation_id":"c1ec0f3c-064d-4904-b008-082d18969987","resolution":{"observed_at":"2026-05-11T14:16:26.065148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-12T10:28:14.014706Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.06264"},"observation_digest":"sha256:8635b60d004c18ae17ae5fb2d775ea48bea4dbd6cd09d9b4519780437419bc91","observation_id":"82917358-2cb2-4ecd-a980-b3ad05c3c46f","resolution":{"observed_at":"2026-05-12T10:28:14.138973Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-10T14:21:56.979989Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-10T17:39:18.008522Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.979989Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:f1e5b7fb2dfffaecaf915603acbfaad0689b1e7289b86505aadfc6ac4d792b62","observation_id":"3e0fe9cf-f618-4751-95ca-173c00fee50e","resolution":{"observed_at":"2026-08-10T14:21:56.979989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-10T10:58:29.045502Z","title":"Audiobox: Unified audio genera- tion with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16761","last_updated":"2025-01-28T07:32:07Z","snapshot_observed_at":"2026-08-10T11:55:13.400322Z","submitted_at":"2025-01-28T07:32:07Z","title":"CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T10:58:29.045502Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2501.16761"},"observation_digest":"sha256:2b0987960f5d96ae429b7da06f53108977c4ff1b60678eab6dbf75dc90ce1357","observation_id":"1f6b83bd-d021-4081-b844-7266387cb578","resolution":{"observed_at":"2026-08-10T10:58:29.045502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-09T20:50:17.331087Z","title":"Audiobox: Unified au- dio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-10T16:30:40.863297Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.331087Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:5e99b97607ba5961d8cbe417bea41c3bfe29f071a17ae694e09be1af0fcf2155","observation_id":"ba086c40-95b3-425b-8253-8c5412fe4d0d","resolution":{"observed_at":"2026-08-09T20:50:17.331087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-09T18:51:12.656812Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00500","last_updated":"2025-02-04T15:19:12Z","snapshot_observed_at":"2026-08-10T02:49:33.781140Z","submitted_at":"2025-02-01T17:40:11Z","title":"Video Latent Flow Matching: Optimal Polynomial Projections for Video Interpolation and Extrapolation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T18:51:12.656812Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.00500"},"observation_digest":"sha256:46a09632bc667ed9e961e5fc2dab499f9cf07c71d9cc09a9dd8a1834df1848ed","observation_id":"2415d845-f9a1-4ae3-bb0b-742007a90c25","resolution":{"observed_at":"2026-08-09T18:51:12.656812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-09T05:54:18.761884Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.761884Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:971533c7f63cb447c72c95e8843c0cade35ebceae993d680b201b153b89cb324","observation_id":"163393c2-c867-4746-b125-fe627ac4467d","resolution":{"observed_at":"2026-08-09T05:54:18.761884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-17T00:30:51.265062Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.05139"},"observation_digest":"sha256:f20b539fbfb09c5b832853605046fdf7f808353f574c52639aea9e4071aff8bd","observation_id":"1de5ba83-5a11-4c40-9eda-c9d19a19f0fa","resolution":{"observed_at":"2026-05-17T00:30:51.367209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T13:26:19.205829Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-10T19:02:33.443135Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.205829Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:890893c9ccabef0f0a87450e4c57478a81ba07d4d5c3e4a12ff6b0e713f67640","observation_id":"f9b274d1-daa9-4b5a-85f6-5411061b25d3","resolution":{"observed_at":"2026-08-08T13:26:19.205829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T13:06:32.937055Z","title":"Audiobox: Unified audio gener- ation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07345","last_updated":"2025-02-11T08:17:07Z","snapshot_observed_at":"2026-08-09T03:27:15.707202Z","submitted_at":"2025-02-11T08:17:07Z","title":"Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T13:06:32.937055Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07345"},"observation_digest":"sha256:970f402c89bfd0f72079bc4f76463d0990a01c522409a3fcbec38f968d1d2bff","observation_id":"2ab885eb-2fbd-44b9-a22a-87a76227beed","resolution":{"observed_at":"2026-08-08T13:06:32.937055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T12:21:44.261324Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07562","last_updated":"2025-02-11T14:00:12Z","snapshot_observed_at":"2026-08-10T10:49:12.757674Z","submitted_at":"2025-02-11T14:00:12Z","title":"LoRP-TTS: Low-Rank Personalized Text-To-Speech","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T12:21:44.261324Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07562"},"observation_digest":"sha256:9fdc3f99b73cc4fe03d2c3bc0e6a599834bd7bfe67fdee649d3c4c83dd7281f9","observation_id":"053015d6-0d7b-49f1-b8b8-ec50576d9198","resolution":{"observed_at":"2026-08-08T12:21:44.261324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T11:51:21.819764Z","title":"Audiobox: Unified Au- dio Generation with Natural Language Prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.819764Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:8aa3e555008a0fda5db929d3a435f487bbf546971908f414639ae1ec45a9bdc8","observation_id":"5236f2fc-4bde-4a3f-a90b-7afba7cc9d0f","resolution":{"observed_at":"2026-08-08T11:51:21.819764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T14:32:42.653144Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-10T19:13:21.450416Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.653144Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:e0ef89034814f0cfc6aa7ef984477a0f9492bec49283717973d437fa5cf01f50","observation_id":"9ae32be0-7d26-4b9d-b5f7-32d78822003b","resolution":{"observed_at":"2026-08-07T14:32:42.653144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T14:19:56.842801Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.842801Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:a0feec5d0bcd8f17d2c769bbd38f2e90791dadaf6a6809d857f520472cbddb25","observation_id":"a77996d5-2d3b-4528-9b14-7bd57feddcde","resolution":{"observed_at":"2026-08-07T14:19:56.842801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T14:05:04.049255Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:04.049255Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.20147"},"observation_digest":"sha256:7991dd82458f8f5f8ec9bf6eb2941a78f7f3750bb0d7630c8bd63f7acd166b90","observation_id":"7ec86a7c-90b7-4ae1-af69-b106424ed52e","resolution":{"observed_at":"2026-08-07T14:05:04.049255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T11:59:49.503496Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00927","last_updated":"2025-06-01T09:41:56Z","snapshot_observed_at":"2026-08-08T23:02:00.996998Z","submitted_at":"2025-06-01T09:41:56Z","title":"In-the-wild Audio Spatialization with Flexible Text-guided Localization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:49.503496Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.00927"},"observation_digest":"sha256:d6937b68194c38f3b144b1f05b4a5c4fbeca96fda96d258f39b2b9e5ac307fa0","observation_id":"0cad407e-8458-4f77-ac9a-8ffe4e44edda","resolution":{"observed_at":"2026-08-07T11:59:49.503496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T11:15:29.298666Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03020","last_updated":"2025-06-03T15:57:55Z","snapshot_observed_at":"2026-08-09T03:27:16.802891Z","submitted_at":"2025-06-03T15:57:55Z","title":"InfiniteAudio: Infinite-Length Audio Generation with Consistency","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:29.298666Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.03020"},"observation_digest":"sha256:b6da271817901fa8324b42d0132ca8277ab84d1a3b9efa792f4c459eec08e55c","observation_id":"8a35ce5e-51c7-41c7-b247-0f98169daa3c","resolution":{"observed_at":"2026-08-07T11:15:29.298666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T05:12:24.856067Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-10T03:55:57.676025Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.856067Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:3f5f4c65030e96d60d83b80a2767f16a3fe70fb682357ffad59addd28d1c9217","observation_id":"25c4f62d-2778-41f1-879b-66735e0cfc0f","resolution":{"observed_at":"2026-08-07T05:12:24.856067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T04:45:19.234441Z","title":"Vyas, A., Shi, B., Le, M., Tjandra, A., Wu, Y .-C., Guo, B., Zhang, J., Zhang, X., Adkins, R., Ngan, W., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-07T16:56:30.600491Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:19.234441Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:7adcbdcf0a7e004abb97c238f8679d8682811e2af2d3d25278fef3e83040a488","observation_id":"78962cc4-95b9-4726-bf81-1735024ca5ba","resolution":{"observed_at":"2026-08-07T04:45:19.234441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-06T20:17:14.641009Z","title":"Audiobox: Unified audio gener- ation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03468","last_updated":"2025-08-29T06:01:31Z","snapshot_observed_at":"2026-08-09T07:54:52.413159Z","submitted_at":"2025-07-04T10:46:11Z","title":"Robust Localization of Partially Fake Speech: Metrics and Out-of-Domain Evaluation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:14.641009Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2507.03468"},"observation_digest":"sha256:fa19a9b7a295466114a967a76fa9527c3623ef882992003bcb9f94703f827dee","observation_id":"d77c8120-21a5-4283-bef7-4f137d735d91","resolution":{"observed_at":"2026-08-06T20:17:14.641009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-06T17:52:01.451574Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-08T23:02:17.585184Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.451574Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:c428fa62854d1a695bf45ff1037261290558c697734affc6437b1cb189ffbc97","observation_id":"cca6c30e-5db6-455d-9495-cd915c13d794","resolution":{"observed_at":"2026-08-06T17:52:01.451574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-06T16:40:49.645421Z","title":"Audiobox: Unified audio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12890","last_updated":"2025-07-24T08:15:02Z","snapshot_observed_at":"2026-08-08T03:25:27.344834Z","submitted_at":"2025-07-17T08:18:55Z","title":"DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:40:49.645421Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2507.12890"},"observation_digest":"sha256:dd531710b5704e61ebb22d743321f6ce8bbe326a854abda0ded639e7dca67090","observation_id":"f3fd9f59-84fe-4f00-8876-9f085173922a","resolution":{"observed_at":"2026-08-06T16:40:49.645421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2509.06027","last_updated":"2026-04-27T10:03:51Z","snapshot_observed_at":"2026-07-06T22:25:11.957177Z","submitted_at":"2025-09-07T12:06:21Z","title":"DreamAudio: Customized Text-to-Audio Generation with Diffusion Models","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T18:26:51.583145Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2509.06027"},"observation_digest":"sha256:7919ea0f4771136106919dc8e867d39c8aedf36e2094879e8684f1a9d1763c13","observation_id":"5e1be8c0-385a-42bf-8d7f-0378490c6428","resolution":{"observed_at":"2026-05-18T18:31:44.672162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-04T21:25:27.303876Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts.ArXiv, 2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:27.303876Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:893b616274db4bd90ccb739e13f9681ae02bd5c6083038886422ca5b3c538b16","observation_id":"0c609199-248d-450a-8ba7-1316a92b2f4f","resolution":{"observed_at":"2026-08-04T21:25:27.303876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-04T08:29:17.809858Z","title":"Audiobox: Unified audio genera- tion with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.20441","last_updated":"2026-07-02T11:50:55Z","snapshot_observed_at":"2026-08-05T03:41:48.846991Z","submitted_at":"2025-10-23T11:22:24Z","title":"UniSE: A Unified Framework for Decoder-Only Autoregressive LM-Based Speech Enhancement","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:29:17.809858Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2510.20441"},"observation_digest":"sha256:d079e925ca5d6645d85c700ed71e19af5df680d5e192f18652be7eb27033ea8c","observation_id":"85c5340e-9405-4a0c-a097-db088a4fb847","resolution":{"observed_at":"2026-08-04T08:29:17.809858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-04T06:47:08.922024Z","title":"Audiobox: Unified au- dio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20635","last_updated":"2026-08-02T05:27:14Z","snapshot_observed_at":"2026-08-08T05:22:59.737639Z","submitted_at":"2025-11-25T18:54:16Z","title":"iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:08.922024Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2511.20635"},"observation_digest":"sha256:fdf612d8cc238bdfd76d83913cde7d77d7ab4ff4730eccf6be02237375991b13","observation_id":"abe87faf-64e1-4cfe-9174-d11e04825029","resolution":{"observed_at":"2026-08-04T06:47:08.922024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-03T20:15:14.257145Z","title":"Audiobox: Unified au- dio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.21029","last_updated":"2026-06-22T20:04:30Z","snapshot_observed_at":"2026-08-06T10:26:20.620397Z","submitted_at":"2025-11-26T03:53:10Z","title":"FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:14.257145Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2511.21029"},"observation_digest":"sha256:1f9a30a84d5ff7ff4de58b3461cc3fc128b05ab55c9ec5d03beef6cbe737ac85","observation_id":"54156058-05fa-4072-93ba-39b32cde10fd","resolution":{"observed_at":"2026-08-03T20:15:14.257145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-03T06:36:33.115934Z","title":"Au- diobox: Unified audio generation with natural language prompts.arXiv preprint arXiv:2312.15821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-05T03:41:49.406487Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.115934Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:404cb06e2b01fdb53ede23e6d3fc07ae91f56960479bbf304000aa87890c8c24","observation_id":"78d2d6a9-4041-44da-9dfb-4a344fb57ac6","resolution":{"observed_at":"2026-08-03T06:36:33.115934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:f001288bea73433f0b95748c9497fd46b7679ab57cd4da86fb7d34c5f0c5cc0c","observation_id":"42ed3b4b-f6c3-4c91-ba67-bc68f8dad714","resolution":{"observed_at":"2026-05-10T23:50:51.864433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2604.08580","last_updated":"2026-07-01T19:51:03Z","snapshot_observed_at":"2026-07-13T17:03:24.183921Z","submitted_at":"2026-03-28T13:01:01Z","title":"Adjoint Matching through the Lens of the Stochastic Maximum Principle in Optimal Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T22:25:53.037164Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2604.08580"},"observation_digest":"sha256:d3af94e10fa783149615443aa35d9a68dddd44181db72db687e110abf34e21e0","observation_id":"b384b49b-ef6e-4168-93ae-0a5b55b3b17d","resolution":{"observed_at":"2026-05-14T22:28:04.692081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2604.09111","last_updated":"2026-05-02T12:23:17Z","snapshot_observed_at":"2026-08-02T17:36:30.384916Z","submitted_at":"2026-04-10T08:42:45Z","title":"PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:43.379525Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2604.09111"},"observation_digest":"sha256:efcea5e5c860c87ec39b7be81a6273845d4ecf7a6b38b4a24d755a0c45b27392","observation_id":"ffc0fb2c-350d-44f9-86f3-c1c906de81fc","resolution":{"observed_at":"2026-05-11T06:56:04.361972Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.00229","last_updated":"2026-04-30T21:06:46Z","snapshot_observed_at":"2026-07-06T23:13:42.661364Z","submitted_at":"2026-04-30T21:06:46Z","title":"A unified perspective on fine-tuning and sampling with diffusion and flow models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-09T19:43:42.331642Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.00229"},"observation_digest":"sha256:f4f308f27d8a38204d7085069c1fd77956ded48a983aa7ea597ef2fbdf9c1141","observation_id":"0746874f-c294-4504-8dd5-241db0182cff","resolution":{"observed_at":"2026-05-11T15:31:21.370267Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-04T21:56:38.114801Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:200467603b833f2ec41e5b4ec42bee92d587df9ffc0916dbd9c922a51050404a","observation_id":"1d819b93-7627-48bd-b92b-619c12b3a0ee","resolution":{"observed_at":"2026-05-11T15:46:41.933376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-01T08:29:29.120570Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:14.734682Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.08729"},"observation_digest":"sha256:cb555c86108a1f10b7e4600313d88dc978593455ffa05e320c80659602400259","observation_id":"66c3dcb2-33d5-4afa-a404-39d9a448298f","resolution":{"observed_at":"2026-05-12T07:36:45.292578Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-01T08:29:29.120570Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T23:26:46.077894Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.08729"},"observation_digest":"sha256:566b02767293012832bac41ef7b876414ca052381d7b27b97e5fea6c81d9a2af","observation_id":"fae6d979-9042-4207-ac15-07057f9144df","resolution":{"observed_at":"2026-06-30T23:35:07.877386Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-04T04:39:45.061732Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:923c785903838e640a9393705459038f8caba2d5431a6e764013e528e3c3d49f","observation_id":"adaf4418-7ee9-45c4-a77b-e9c57146a96f","resolution":{"observed_at":"2026-05-20T14:13:21.342726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-09T04:08:48.023047Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:dba80ebe69df5b61344d2e23549b7b4022562aeb80125c6a2290cf0269e91a5b","observation_id":"6c1d55db-e97a-4f06-b3ca-42f193b15c9e","resolution":{"observed_at":"2026-06-30T13:44:41.261751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.28063","last_updated":"2026-05-27T07:15:35Z","snapshot_observed_at":"2026-08-06T20:35:40.532245Z","submitted_at":"2026-05-27T07:15:35Z","title":"Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T10:28:18.202974Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.28063"},"observation_digest":"sha256:c41cb364615def39176e0323e3aac0b432f932e1d163f04dcadfa62128cb2264","observation_id":"444d884a-4575-45da-9dac-ac58abdf689f","resolution":{"observed_at":"2026-06-29T10:33:17.930200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.30965","last_updated":"2026-05-29T07:58:54Z","snapshot_observed_at":"2026-08-02T19:54:21.945716Z","submitted_at":"2026-05-29T07:58:54Z","title":"ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T21:12:19.893944Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.30965"},"observation_digest":"sha256:2610f2533debf01c43ccc5b71b806d38668df4411e2534326bf5c54a6a38ec2e","observation_id":"688eb36f-523f-4e77-a7fc-6e0b0fb11064","resolution":{"observed_at":"2026-07-01T20:26:12.626271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2605.31530","last_updated":"2026-06-02T14:24:03Z","snapshot_observed_at":"2026-08-09T20:03:21.928478Z","submitted_at":"2026-05-29T16:43:07Z","title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T20:44:20.190064Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2605.31530"},"observation_digest":"sha256:dbc899997d326fbb0b05d0bc7ef144cfb18b6eb6499617db5d19cf6e90d5057e","observation_id":"087fe4f2-13f7-432f-bd41-19685fa2e3c3","resolution":{"observed_at":"2026-06-28T20:52:37.917213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.02739","last_updated":"2026-06-01T18:05:18Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T18:05:18Z","title":"EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T12:34:06.024192Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.02739"},"observation_digest":"sha256:2528897cb71243a889db83772c595bfc04ffd210311d98314d00cd58a87c6bcd","observation_id":"435d69f2-c82f-4b7e-b121-cff147ec5199","resolution":{"observed_at":"2026-06-28T12:42:08.983227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-07-06T23:46:37.903443Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:9b3894a57627bee552df8285af7acf8b4e3b451ee448548989dc92712c9edde0","observation_id":"590a8127-654d-4387-90f6-df1426c6ce91","resolution":{"observed_at":"2026-07-02T19:47:19.711855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:c622a2951cc7611feb390a8bb9c152c8ea6a37e5f9a83f25ead0602315773556","observation_id":"2c590f6f-ae5c-47a6-bbc3-0c9cbd2afdb7","resolution":{"observed_at":"2026-07-03T03:27:35.662075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:2450b321b19e31859a08a9ab39fcf42f861927e68a14fb7efd215d94dd4c82d6","observation_id":"2278720b-7402-4a96-ade9-baf10dabe26a","resolution":{"observed_at":"2026-07-04T11:59:50.917841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.31729","last_updated":"2026-06-30T14:28:41Z","snapshot_observed_at":"2026-08-07T11:38:14.977292Z","submitted_at":"2026-06-30T14:28:41Z","title":"Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T03:32:23.838961Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.31729"},"observation_digest":"sha256:52dd673405ab79bb6fb697d49f8195196829fe0a61d49d989239006e75e5dac6","observation_id":"980e0768-d242-4eb0-a098-4155afd207f7","resolution":{"observed_at":"2026-07-01T11:55:42.956747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-07-11T12:34:20.057072Z","title":"Available: https://arxiv.org/abs/2312.15821","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04848","last_updated":"2026-07-06T09:19:03Z","snapshot_observed_at":"2026-08-07T07:26:18.976803Z","submitted_at":"2026-07-06T09:19:03Z","title":"SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T12:34:20.057072Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.04848"},"observation_digest":"sha256:da5a4cc7ded5ac0dd1f1cbdb48cbe6f19eb787d38931d6f29e92fd3c7db85e5a","observation_id":"a3d23cec-77d5-403f-9493-0bf03a9ec394","resolution":{"observed_at":"2026-07-11T12:34:20.057072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:7a25df0d806f988f9a1258888f22ea118a5940cc8d3ab9a06a4348ea6ec4e4ae","observation_id":"a4231bb2-8c63-4c46-82fd-17b2e69f233a","resolution":{"observed_at":"2026-07-08T00:04:22.480374Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2312.15821 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:fa79725cc15609332d8aeae43062a3df0324d9d30cf0529e7b1124f92d9ad546","observation_id":"7a7202ec-e2cb-4f8f-b476-2fe65d39ecad","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-07-30T14:08:14.459751Z","title":"Audiobox: Unified audio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-10T00:25:40.913179Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-30T14:08:14.459751Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:2065f052729b1758f52a2388f5cfe48b4fd9a5a8ff500e867ce22a4e0b07f922","observation_id":"4d288361-f52f-4898-a045-1092ca4af2de","resolution":{"observed_at":"2026-07-30T14:08:14.459751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-01T10:17:26.573299Z","title":"Audiobox: Unified audio generation with natural language prompts.arXiv preprint arXiv:2312.15821, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27011","last_updated":"2026-07-30T08:12:52Z","snapshot_observed_at":"2026-08-10T00:25:40.913179Z","submitted_at":"2026-07-29T15:06:58Z","title":"Qwen-Audio-3.0-Gen-Preview Technical Report","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T10:17:26.573299Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2607.27011"},"observation_digest":"sha256:35b05b91bd3cdc0aff638839d94c4d4dcd3ed4b405e61e5e4d635bdb381ecbaa","observation_id":"e525aefd-e97b-4c32-93ce-dc1f3fa08ff8","resolution":{"observed_at":"2026-08-01T10:17:26.573299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.15821/citation-record","integrity":"/paper/2312.15821/integrity","json":"/paper/2312.15821/citation-record.json","paper":"/paper/2312.15821"},"outbound":[],"paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 50 inbound Pith citation observations for arXiv:2312.15821."}