Pith. sign in

Paper Citation Record · LEDGER

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

As of 13 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2608.09571.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.09571 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T14:54:55.275856Z

measured 58 of 58 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

58 of 58 outbound references displayed

  • verified exact3
  • verified fuzzy30
  • unresolved24
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation afd02cc8-07cd-496d-a50f-5e442ff4c8c2 · outbound

This paper cites an unresolved cited work.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-11T14:54:56.272037Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.028632Z digest=sha256:9dd36968eadef9fce58673e8dd57539e97e8311aadc03dd62bbad9047944f8b4

Observation 4eed1274-ef77-48e1-b345-c3ae0df48eb6 · outbound

This paper cites V oicebox: Text-guided multilingual universal speech generation at 8 scale.Advances in neural information processing systems, 36:14005–14034, 2023.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation V oicebox: Text-guided multilingual universal speech generation at 8 scale.Advances in neural information processing systems, 36:14005–14034, 2023

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.257290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.033145Z digest=sha256:74cb5659f8a25a8281e0c093a18f2d30fab8a8b3e9a2e85a7bf8436fa7abd6b8

Observation fb1a21ac-4182-42ba-84e7-1f03920daa17 · outbound

This paper cites F5- TTS: A fairytaler that fakes fluent and faithful speech with flow matching.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation F5- TTS: A fairytaler that fakes fluent and faithful speech with flow matching

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.242505Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.038148Z digest=sha256:432cf834999a6ee47955cf080c8d46bfbebf2d8f8a62de0bb789be574bc608b0

Observation c3e5f785-c4a8-424a-8b6e-b1cbf54b13c0 · outbound

This paper cites Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.228130Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.042819Z digest=sha256:a60afdc7e449d4468de0543178375e195edfc208858ea9bd90c5a2680de262a1

Observation 4fa110ad-eb7a-4c90-9dca-66fc47c1d481 · outbound

This paper cites Plumbley.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Plumbley

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.212486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.047662Z digest=sha256:50fbddd46e6c3abc2aa7bc3b65d887cc1d19c9a87be40db31c71304521caf5eb

Observation c268a083-01d3-4d96-ae51-f753edf7da14 · outbound

This paper cites an unresolved cited work.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-11T14:54:56.196252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.052640Z digest=sha256:9de8710478c45b4deb9ddb5724c529ec817ea4abbce6e30e752b3d0698f7bf75

Observation cdbad638-fd23-48e1-bf05-11a5343a5750 · outbound

This paper cites Audiobox: Unified Audio Generation with Natural Language Prompts.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Audiobox: Unified Audio Generation with Natural Language Prompts

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.057843Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.057843Z digest=sha256:cd3fdc8f91c11ae19a481d99cb48fa674439ed8061ca333f71543b680f200fe3

Observation a466b657-6ca1-489c-921d-c11eb11d7be7 · outbound

This paper cites Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-11T14:54:55.619644Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.067522Z digest=sha256:01dceb947068ed3fbf951748b73edc651bdca4b8524ca160660af8a627a18513

Observation f59e3dc8-afac-4863-b9ef-1593a0f9b875 · outbound

This paper cites UniMoE-Audio: Unified speech and music generation with dynamic- capacity mixture-of-experts.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation UniMoE-Audio: Unified speech and music generation with dynamic- capacity mixture-of-experts

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.178829Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.072212Z digest=sha256:92e17ddb2bebd007c716af54c7b7f27788c0831f67d009feefab2ea1687231a8

Observation 8e6278e1-319a-45e0-9363-943639f4f052 · outbound

This paper cites Mandic, Wenwu Wang, and Mark D.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Mandic, Wenwu Wang, and Mark D

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.163243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.076050Z digest=sha256:38c1b88ba31170cee16d08cea21718382a5a213f54c4a9eda6fc4f93c84a87fb

Observation a826b188-4b5a-4d18-bb33-6e4b0ca9c963 · outbound

This paper cites UniSonate: A unified model for speech, music, and sound effect generation with text instructions.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation UniSonate: A unified model for speech, music, and sound effect generation with text instructions

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.148464Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.079733Z digest=sha256:0d414ee856e8744247fabb99296c207f846df2a0b27c0f66bdf0c861940a43e6

Observation 79092f9d-7ac3-4d2d-b7e0-8a2dbf9f2cda · outbound

This paper cites Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.083682Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.083682Z digest=sha256:8008e70ce082e3fc572f28a7fcf9772b0eb86f63c80c42a1d3be1044664a72a0

Observation d82903fd-9735-4cd8-81ec-05f31fbda54c · outbound

This paper cites Text-to-audio generation using in- struction guided latent diffusion model.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Text-to-audio generation using in- struction guided latent diffusion model

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.133911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.087986Z digest=sha256:3a35ef47aa7603b0657eb9579e66e66d8a0973b6464e4ef803c8da03d5ff37d9

Observation 54b05279-be64-43e9-8226-51d3f4c08fac · outbound

This paper cites Freeaudio: Training-free timing plan- ning for controllable long-form text-to-audio generation.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Freeaudio: Training-free timing plan- ning for controllable long-form text-to-audio generation

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.119443Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.091787Z digest=sha256:50fabf743dfecc87726eb92ba5575c705effd16c7a8580972053f4fce0f96bf0

Observation e04a2ccd-3fd9-4258-a87f-8fe0dd487153 · outbound

This paper cites Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learn- ing Research, 23(120):1–39, 2022.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learn- ing Research, 23(120):1–39, 2022

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.095477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.095477Z digest=sha256:05dba532fa137a205e20f51079caec79a25e135896a02af26d99f33675e763f5

Observation 62964b0e-7417-4d5b-9b98-07b190c2032c · outbound

This paper cites Scaling Diffusion Transformers to 16 Billion Parameters.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Scaling Diffusion Transformers to 16 Billion Parameters

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.099279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.099279Z digest=sha256:e436be71f2806964eb218d99a5cc640cc53fc1d561a8d8bb4dc34321c82cd0d0

Observation 1ea80760-c232-497a-bed6-eb0602fcff01 · outbound

This paper cites Switch diffu- sion transformer: Synergizing denoising tasks with sparse mixture-of-experts.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Switch diffu- sion transformer: Synergizing denoising tasks with sparse mixture-of-experts

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.095129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.103831Z digest=sha256:4cd0e465132c1096c7b888ea914998b5d78681311fd8bba15246bf7f7b979bf0

Observation f5509802-f7a0-46ce-8b60-2855f3ce56b7 · outbound

This paper cites EC-DIT: Scaling diffusion transformers with adaptive expert-choice routing.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation EC-DIT: Scaling diffusion transformers with adaptive expert-choice routing

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.079884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.108164Z digest=sha256:dc4cd2195d40c9d73c9240db0686ca57aeedc5f6f1c732cb54dcd4c021cb1863

Observation 91b25063-e225-4f9a-92d6-762f8998988d · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.113059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.113059Z digest=sha256:fe5e0758e804f9221a515beac924604fe6c98f06b452070531c0689b770113ac

Observation 7c0ebbd6-d290-41f6-9327-a19b0d50143d · outbound

This paper cites Scalable diffusion mod- els with transformers.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Scalable diffusion mod- els with transformers

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.065225Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.117751Z digest=sha256:f27e375735a26dee12c2d22968fee7200ee3a99e8fde1b04c016697d3d932341

Observation ec6c0a83-9fa1-445a-aa46-3864d9e1d3cb · outbound

This paper cites Learning transferable visual models from natural language supervision.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Learning transferable visual models from natural language supervision

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.052100Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.122187Z digest=sha256:c4e21811a8c528876b74d3ba524910a773f9e3805e543c73297f1df7a3441d55

Observation 8a2bcaef-be1c-44b5-9a36-b84fec2768e0 · outbound

This paper cites CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.126911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.126911Z digest=sha256:3e28255b31a3438eb339ee7b8a875a4f4b4357c30ed3f169606b013f40c84160

Observation 0e10443b-a2af-4cb4-9da5-27e2fbf33a07 · outbound

This paper cites Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.131781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.131781Z digest=sha256:4584913db37bc95b83f6d899debd7b917e547b24c9b07a480c39e0d3a5e55812

Observation 0669497a-4ea5-47c6-8599-cf94c0d5df74 · outbound

This paper cites Simple and controllable music generation.Advances in neural information processing systems, 36:47704–47720, 2023.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Simple and controllable music generation.Advances in neural information processing systems, 36:47704–47720, 2023

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.038847Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.136657Z digest=sha256:130b61c9544c04f671a10bb79159ae23fd9bd0f3e67ef7868e02e4e3379d18d2

Observation ef7088ac-e0e6-4331-a5c5-bff7ee09a496 · outbound

This paper cites SegTune: Structured and fine-grained con- trol for song generation.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation SegTune: Structured and fine-grained con- trol for song generation

Reference 25

Resolution
verified exact
doi, observed 2026-08-11T14:54:55.528507Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.140918Z digest=sha256:5b3309c6359c64531f3870da573c4e867cae5770707e936ee60eba06f7069922

Observation a41bb708-5063-4773-a12d-b90f59ac082e · outbound

This paper cites Qwen2.5-Omni Technical Report.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Qwen2.5-Omni Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.144842Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.144842Z digest=sha256:ef5ecc0dd6405c1c601dd97dc52e5cdfe263922f05106c96217197a0e6d367fa

Observation fda2e9ef-d7ff-4da9-a101-f60dad53afd7 · outbound

This paper cites Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.025058Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.153623Z digest=sha256:8ee2c35a178db613bb6cd020e0a150d79830288ad303cf1dacd1ad1bd98ae9f9

Observation 386c4899-330e-4995-a944-fd706fcd1e3d · outbound

This paper cites Audiox: A unified framework for anything-to-audio generation.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Audiox: A unified framework for anything-to-audio generation

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:56.010531Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.157870Z digest=sha256:b1a60f2148177e0a0b39ec3d2c629aee2c6a66cad80473db71ed59eeede32b66

Observation ddc464a5-37d5-489e-bdb3-37f041586904 · outbound

This paper cites Higgs Audio V2: Redefining expressiveness in audio generation.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Higgs Audio V2: Redefining expressiveness in audio generation

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.995338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.161824Z digest=sha256:fb5e85a7719b0e7987bfe8d1f47965cfebe1d26962d63b56a16b09be9d1a0bb7

Observation 4ae51aae-4b50-4398-bbf1-ffeb860a1e57 · outbound

This paper cites UniFlow- Audio: Unified flow matching for audio generation from omni-modalities.CoRR, abs/2509.24391, 2025.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation UniFlow- Audio: Unified flow matching for audio generation from omni-modalities.CoRR, abs/2509.24391, 2025

Reference 30

Resolution
verified exact
doi, observed 2026-08-11T14:54:55.499848Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.165701Z digest=sha256:09c6466af36174a9ab72f1d42085be4f9707c1f9f4ec204201b436ed2c998916

Observation 955e52c4-3a3b-455c-8728-ad26f9cbfee5 · outbound

This paper cites Supervised learning of universal sentence representations from natural language inference data.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Supervised learning of universal sentence representations from natural language inference data

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.169530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.169530Z digest=sha256:f3a5b561bd86192019dabaf1cc069f9f7618a9f59ce91b2420f29f1c0394d062

Observation abcac6ea-9023-46a7-83e5-f42822daecd6 · outbound

This paper cites Classifier-Free Diffusion Guidance.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Classifier-Free Diffusion Guidance

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.173499Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.173499Z digest=sha256:3ae04924455757a441ba3b6fc6a11e392ed572b78cfb3d0920af50c0056b280f

Observation 6004f259-5b16-45c1-a7ea-f7031326e77c · outbound

This paper cites Eliminating oversaturation and artifacts of high guidance scales in diffusion models.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Eliminating oversaturation and artifacts of high guidance scales in diffusion models

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.978801Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.178905Z digest=sha256:b17107f8953de253d9f8957d9ec8ca91e4df702b356174bb02e77b537a0d1d3f

Observation ac4144c2-224e-423e-9d08-114090bf528a · outbound

This paper cites Seed-TTS: A Family of High-Quality Versatile Speech Generation Models.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Seed-TTS: A Family of High-Quality Versatile Speech Generation Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.183277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.183277Z digest=sha256:747b05f41677935e99e2d972a7240ba71145f188483ca60f4c437dd009738513

Observation 371dd502-aa54-4b93-8057-8f167f221832 · outbound

This paper cites Librispeech-pc: Benchmark for evaluation of punc- tuation and capitalization capabilities of end-to-end asr models.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Librispeech-pc: Benchmark for evaluation of punc- tuation and capitalization capabilities of end-to-end asr models

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.963729Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.188042Z digest=sha256:da88f47a2b5ce40d274d821d3db33b9651aef20c7213f6b9548f6781ac42e90c

Observation b2798beb-52d1-42af-ac10-55cdf9072415 · outbound

This paper cites AudioCaps: Generating captions for audios in the wild.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation AudioCaps: Generating captions for audios in the wild

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.948849Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.192582Z digest=sha256:966ddbef7ae2973b221f741acf8af78bcaf3d3cb060cae019a1cc9a91a83af2d

Observation 7f6a365e-c732-4d60-b0d2-c35994108945 · outbound

This paper cites MusicLM: Generating Music From Text.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation MusicLM: Generating Music From Text

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.196931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.196931Z digest=sha256:06a6b590ee26d6932fe1d9df4645e64f9f765cadefaac039125b4770cb776281

Observation b68f9f84-a28b-4284-9d43-227b77b4bca7 · outbound

This paper cites The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.201613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.201613Z digest=sha256:f3c8e0a33d9345038c7a2b1fb855695713e644581412966ff5f877efced7627d

Observation 9242d031-4e69-4b04-9d86-ddf022d84c86 · outbound

This paper cites Qwen3-VL Technical Report.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Qwen3-VL Technical Report

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.206209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.206209Z digest=sha256:570b4d504fdd83b5285b4de0540504a5ea743bc3faf9b94331229dbf0bfa0b2f

Observation 0cb6a07a-4fb6-4c10-b20e-18cc239d67a0 · outbound

This paper cites Robust speech recognition via large-scale weak supervision.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Robust speech recognition via large-scale weak supervision

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.935113Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.210869Z digest=sha256:5ca869f6d447c9e9e4acaea3af08b7e6f234ad0d2cfdca25c3bfd24d35407843

Observation c7d98b08-56b2-46b5-bba9-9d43b7952fa7 · outbound

This paper cites rain” may be an event in sfx, “an urban street in a downpour.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation rain” may be an event in sfx, “an urban street in a downpour

Reference 41

Resolution
malformed identifier
raw_fallback, observed 2026-08-11T14:54:55.921565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.215282Z digest=sha256:0a0b24926e6b17669d2c69b9bfba8e27c422f36b967e4c397232ce053aad4aa7

Observation f7f18d1f-6b9b-4db2-b40a-3db806700a16 · outbound

This paper cites rule-based templates.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation rule-based templates

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.907528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.219349Z digest=sha256:3d00092affc4bfcb2947caf2ee3c615b24121c61b70d661873522de21bc0ea23

Observation 1fa24644-4753-455f-b26b-eb41a89cd3be · outbound

This paper cites Do not include markdown, explana- tions, or extra text.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Do not include markdown, explana- tions, or extra text

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.893520Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.223346Z digest=sha256:d115e193441f29f3140857e5a9c207c052863af2fbc7779848c3786e780d1279

Observation 0010179d-e9ce-4f5e-bd02-2954138956d6 · outbound

This paper cites Do not add new keys.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Do not add new keys

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.878723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.227851Z digest=sha256:7fc5426b07ec5f942c572f6f2eb1a22c93e37a9fa640786dd07997879b3b3f9f

Observation 364a779a-e06d-4041-af44-06bacacb3304 · outbound

This paper cites - Do not paraphrase, expand, or rewrite it.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation - Do not paraphrase, expand, or rewrite it

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.863503Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.231770Z digest=sha256:214d0b79a0e038db854e6951152c863d239055f5043abd9a4df644a87ff3fc7d

Observation 28fde77a-e01a-4113-815d-914948893213 · outbound

This paper cites - Otherwise leave it empty.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation - Otherwise leave it empty

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.849051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.235918Z digest=sha256:c696b5391ba089ebdc6bcbb594259205bd890d0c9f2d39b081e8f23cb34bc782

Observation 750581f5-7a9b-4b7d-be7b-b099686e335e · outbound

This paper cites Other- wise leave it empty.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Other- wise leave it empty

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.834994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.239775Z digest=sha256:392d690e7a520abf8d154e383746302e4d765d75ac81d7ac263687990cae5d9d

Observation 465acee9-987c-47c6-bfc0-4dab1cd5d5c7 · outbound

This paper cites an unresolved cited work.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-11T14:54:55.821099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.243879Z digest=sha256:de5a3a0598ca0c6f559a12ae18663dc05c6f439f168745124982c3a218f91e76

Observation ace219d6-1fef-41df-969f-24e92c3f7d29 · outbound

This paper cites - Otherwise leave it empty.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation - Otherwise leave it empty

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.807877Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.247581Z digest=sha256:8e97d0686a66ac646fd69224132ef445f0044f468886c2131b3c47c674a50367

Observation 353f1487-1fbf-4872-a937-cbd532615bd3 · outbound

This paper cites an unresolved cited work.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-08-11T14:54:55.794116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.251276Z digest=sha256:0f989670c8e64c4c0a584693df05b4cfd06da1ed425236b9c9639745c8d3b4b4

Observation 83f9cdc4-50cd-4be2-bf37-b6357e747476 · outbound

This paper cites an unresolved cited work.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-11T14:54:55.778522Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.254890Z digest=sha256:dfa48379e5e1ea3b899ec9228fb7999613ba0c03a70af5b5fa06a5f852987225

Observation 6330a75d-ffd2-4610-a6f9-473999d3b4e5 · outbound

This paper cites an unresolved cited work.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-11T14:54:55.762312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.258634Z digest=sha256:455a0aa08f41cc98cd6bb1d69834d13bf7e6a7cefb05569c65a17011d84455b5

Observation 889cc983-b815-4dd9-a3e1-56cfdcf16dad · outbound

This paper cites an unresolved cited work.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-11T14:54:55.747826Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.262758Z digest=sha256:0128184975d06800b67b725fbbbd58cf6cdbb4c101391a1a38dd98d7ff74a181

Observation 4c9b4f35-0a32-4976-af3c-7a1910d000f2 · outbound

This paper cites 1", "2",.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation 1", "2",

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.733866Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.267346Z digest=sha256:20f6d189bc7728a31a65a892b92adf9343cd2ad0ab9cdca32f18834f3772efeb

Observation 4038b4a8-cdc6-468c-835d-7d4d25138f2f · outbound

This paper cites an unresolved cited work.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-11T14:54:55.720592Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.271550Z digest=sha256:597a41ab8423ac46936d334c6d4e8d9583f3d85646bef4953b87743829f295a1

Observation 0d1a757a-e876-4dc8-b70c-6f66be8fce40 · outbound

This paper cites summary":.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation summary":

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T14:54:55.706330Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-11T14:54:55.275856Z digest=sha256:f339fc3638b08c09e5d320c5fb9d1affb1dd2c27ac813366929315658756f308

Observation 57e5ad33-fe50-4da2-b06f-b3c4ed53a099 · outbound

This paper cites Audiobox: Unified Audio Generation with Natural Language Prompts.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Audiobox: Unified Audio Generation with Natural Language Prompts

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.062732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.062732Z digest=sha256:b5170d40798fc5071508adc78586f07b04ea1810b3a0ae24c616dceb636ffb1e

Observation d2ee54d8-1f0b-469a-98b8-2ae550ef66e5 · outbound

This paper cites Qwen2.5-Omni Technical Report.

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation Qwen2.5-Omni Technical Report

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-11T14:54:55.149373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:54:55.149373Z digest=sha256:d1825f744cbf0ba9966f1e3544ad0f461d97f544639349d63fee3b27c507e106

Pith citing papers

No inbound Pith citation observations are available.