{"as_of":"2026-08-13T17:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:071e091294cf8476bee02a8228fad8085b72b2093bb7d216ed852b9af44f61c4","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:54:55.275856Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09571/citation-record","integrity":"/paper/2608.09571/integrity","json":"/paper/2608.09571/citation-record.json","paper":"/paper/2608.09571"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.267889Z","title":null,"venue":null,"work_id":"b11ceb22-6bb3-4c70-83ff-bd4dccc71ea6","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.028632Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:d87038c7ea54f77d205e86c8af64b07cb933560c03f31ce66e29732565b28f78","observation_id":"afd02cc8-07cd-496d-a50f-5e442ff4c8c2","resolution":{"observed_at":"2026-08-11T14:54:56.272037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.252473Z","title":"V oicebox: Text-guided multilingual universal speech generation at 8 scale.Advances in neural information processing systems, 36:14005–14034, 2023","venue":null,"work_id":"9fb08c7c-74ee-4680-94af-e7c9ab0e85c0","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.033145Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:e204479c3fb036be2a21381022af8313501dc0d8102caf9b53961331ddc0c543","observation_id":"4eed1274-ef77-48e1-b345-c3ae0df48eb6","resolution":{"observed_at":"2026-08-11T14:54:56.257290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.237971Z","title":"F5- TTS: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":"83e7044d-d6a2-4430-a93c-b196c4c694c3","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.038148Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:ddf4b9f1ad39e94c1da08e31e4244d959207a673f40edc46933b7d3e71573f10","observation_id":"fb1a21ac-4182-42ba-84e7-1f03920daa17","resolution":{"observed_at":"2026-08-11T14:54:56.242505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.223502Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":null,"work_id":"d73ec26b-7d20-4257-a123-aad0bba5b557","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.042819Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:55924f70b4957d6b5a26a821877b9b0358386b4420112b81252d0335cfa08ad9","observation_id":"c3e5f785-c4a8-424a-8b6e-b1cbf54b13c0","resolution":{"observed_at":"2026-08-11T14:54:56.228130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.207772Z","title":"Plumbley","venue":null,"work_id":"d3a67f92-6647-4692-8dba-1aeb320492b2","year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.047662Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:5600ee2b92b229c7896e8ba09dfed3e596493e09df9b6668c840321d66586a24","observation_id":"4fa110ad-eb7a-4c90-9dca-66fc47c1d481","resolution":{"observed_at":"2026-08-11T14:54:56.212486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.191084Z","title":null,"venue":null,"work_id":"cd9a9a42-8aed-4026-a79b-87dfbde1ddf5","year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.052640Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:8d4fa3cddb81533e481fc814d3b326c1ad46861670753e19a819a2ec82e3cc61","observation_id":"c268a083-01d3-4d96-ae51-f753edf7da14","resolution":{"observed_at":"2026-08-11T14:54:56.196252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-13T04:54:07.077274Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T14:54:55.057843Z","title":"Audiobox: Unified audio generation with natural language prompts.CoRR, abs/2312.15821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.057843Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:0cdba354653a7f252932fde4c00737f777df34df8b34edea106e514787c5aac9","observation_id":"cdbad638-fd23-48e1-bf05-11a5343a5750","resolution":{"observed_at":"2026-08-11T14:54:55.057843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27838","last_updated":"2026-05-27T01:50:29Z","snapshot_observed_at":"2026-08-13T15:35:37.691793Z","submitted_at":"2026-05-27T01:50:29Z","title":"Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text","version":1},"cited_work":{"arxiv_id":"2605.27838","doi":"10.48550/arxiv.2605.27838","metadata_source":"pith","pith_arxiv_id":"2605.27838","snapshot_observed_at":"2026-08-11T18:16:15.004306Z","title":"Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text","venue":"cs.SD","work_id":"69af8481-4ef8-488b-9407-1f67f1fa0396","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.067522Z"},"links":{"cited_paper":"/paper/2605.27838","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:428463047d16777dda6278d3646863b84ce6246a37afc64d1c82748da39239d4","observation_id":"a466b657-6ca1-489c-921d-c11eb11d7be7","resolution":{"observed_at":"2026-08-11T14:54:55.619644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.173665Z","title":"UniMoE-Audio: Unified speech and music generation with dynamic- capacity mixture-of-experts","venue":null,"work_id":"d34c1c41-2349-4263-a11e-a0180415d43d","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.072212Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:edbb60d64a0fdba181d3df3cdfa2819304276696a59bcbd9cdf5e358b6684838","observation_id":"f59e3dc8-afac-4863-b9ef-1593a0f9b875","resolution":{"observed_at":"2026-08-11T14:54:56.178829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.158527Z","title":"Mandic, Wenwu Wang, and Mark D","venue":null,"work_id":"82df77a7-f92f-402a-abaa-d22bba993f24","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.076050Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:8c14296030b5c64a6c336608b139a1714c01499e0ebffe7a1e20f7cb29c6f22e","observation_id":"8e6278e1-319a-45e0-9363-943639f4f052","resolution":{"observed_at":"2026-08-11T14:54:56.163243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.143778Z","title":"UniSonate: A unified model for speech, music, and sound effect generation with text instructions","venue":null,"work_id":"09b06aac-db37-4818-bd14-b09c23e86563","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.079733Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:b3ccc14c4f2997c182b8fb109db4e547d99a6d516280381ecadd2d6a26d51c02","observation_id":"a826b188-4b5a-4d18-bb33-6e4b0ca9c963","resolution":{"observed_at":"2026-08-11T14:54:56.148464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-13T11:30:24.178620Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-11T14:54:55.083682Z","title":"Make-An-Audio 2: Temporal-enhanced text-to-audio generation.CoRR, abs/2305.18474, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.083682Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:b440dc7f118407cd54d22868422a5c782888cfb87d06cfc692891b0bff87faaa","observation_id":"79092f9d-7ac3-4d2d-b7e0-8a2dbf9f2cda","resolution":{"observed_at":"2026-08-11T14:54:55.083682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.129319Z","title":"Text-to-audio generation using in- struction guided latent diffusion model","venue":null,"work_id":"3f1bc7d6-5d77-4a6a-9cdd-177ee7bb84c2","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.087986Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:e94f18cb4ca9aa9e71af6acb2e986145fa009f98bce0d43474efb15b79826166","observation_id":"d82903fd-9735-4cd8-81ec-05f31fbda54c","resolution":{"observed_at":"2026-08-11T14:54:56.133911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.114638Z","title":"Freeaudio: Training-free timing plan- ning for controllable long-form text-to-audio generation","venue":null,"work_id":"1aeea26e-bdab-441c-87a8-b8451178e5ee","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.091787Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:0dca7812dee52c141c24db2b25359fdf7c2b2dafbdb63b487d0fa00c099cd960","observation_id":"54b05279-be64-43e9-8226-51d3f4c08fac","resolution":{"observed_at":"2026-08-11T14:54:56.119443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.095477Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learn- ing Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.095477Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:1b72751230290f2c215ce8be429b79f620dcaacc5f44d70817883559be63243d","observation_id":"e04a2ccd-3fd9-4258-a87f-8fe0dd487153","resolution":{"observed_at":"2026-08-11T14:54:55.095477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11633","last_updated":"2024-09-09T02:17:12Z","snapshot_observed_at":"2026-08-12T23:21:10.918169Z","submitted_at":"2024-07-16T11:55:23Z","title":"Scaling Diffusion Transformers to 16 Billion Parameters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11633","snapshot_observed_at":"2026-08-11T14:54:55.099279Z","title":"Scaling diffusion transformers to 16 billion parameters.CoRR, abs/2407.11633, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.099279Z"},"links":{"cited_paper":"/paper/2407.11633","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:fa57e1a61de3e44ea2709bcb288e681493d44bc86264d0f3ca56bc6a77bf80ee","observation_id":"62964b0e-7417-4d5b-9b98-07b190c2032c","resolution":{"observed_at":"2026-08-11T14:54:55.099279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.090258Z","title":"Switch diffu- sion transformer: Synergizing denoising tasks with sparse mixture-of-experts","venue":null,"work_id":"9da556bc-a285-49a7-bb8d-2474a3b2e439","year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.103831Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:9387926b74c54e550bb133c57b5f9c22be14c65e40f9617b811d6afdd6df5eab","observation_id":"1ea80760-c232-497a-bed6-eb0602fcff01","resolution":{"observed_at":"2026-08-11T14:54:56.095129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.074869Z","title":"EC-DIT: Scaling diffusion transformers with adaptive expert-choice routing","venue":null,"work_id":"beeec2b7-394b-47a5-86f2-1d8f35f0267b","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.108164Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:210141361662f427eedd68605f21221ebc32d611c431bf06fad8bba8884af27e","observation_id":"f5509802-f7a0-46ce-8b60-2855f3ce56b7","resolution":{"observed_at":"2026-08-11T14:54:56.079884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T14:54:55.113059Z","title":"Qwen2-VL: Enhanc- ing vision-language model’s perception of the world at any resolution.CoRR, abs/2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.113059Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:3e0d90622051e6867fff20ab5a5a2c0f20d85b9ce6e6d67c25ca2f2d4c12f943","observation_id":"91b25063-e225-4f9a-92d6-762f8998988d","resolution":{"observed_at":"2026-08-11T14:54:55.113059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.061052Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":"35bb954d-393e-4fee-b1cb-5555ea1d367d","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.117751Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:12c149fe2dd6dbd210715c4c3bf14bf413562675baf4f608bf12ab46a62f8102","observation_id":"7c0ebbd6-d290-41f6-9327-a19b0d50143d","resolution":{"observed_at":"2026-08-11T14:54:56.065225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.047989Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"244d62c7-5bf0-4e2c-b0f1-dacd30685d90","year":2021},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.122187Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:df901bf964275a01e959609534ecbb8c480e4a7de0fd52544f6d4d531dac6299","observation_id":"ec6c0a83-9fa1-445a-aa46-3864d9e1d3cb","resolution":{"observed_at":"2026-08-11T14:54:56.052100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-11T14:54:55.126911Z","title":"CosyV oice 2: Scalable streaming speech synthesis with large language models.CoRR, abs/2412.10117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.126911Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:ed836635988e94ad5e793562e85bbee8bed7a528d7ff13c07cb2727959b2ad66","observation_id":"8a2bcaef-be1c-44b5-9a36-b84fec2768e0","resolution":{"observed_at":"2026-08-11T14:54:55.126911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-11T14:54:55.131781Z","title":"Step-Audio: Unified understanding and generation in intelligent speech interaction.CoRR, abs/2502.11946, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.131781Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:2e3756197adf6a523c3b8740941affd84a0b279d9a6af12b92262f45a7a64b24","observation_id":"0e10443b-a2af-4cb4-9da5-27e2fbf33a07","resolution":{"observed_at":"2026-08-11T14:54:55.131781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.034405Z","title":"Simple and controllable music generation.Advances in neural information processing systems, 36:47704–47720, 2023","venue":null,"work_id":"ead99ef5-79fb-48d7-a1ac-b248c87a0b56","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.136657Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:6ff27b1bc3d3047a6648dd55d4daa16824486ae43927f4e6dfc267d9d7d98365","observation_id":"0669497a-4ea5-47c6-8599-cf94c0d5df74","resolution":{"observed_at":"2026-08-11T14:54:56.038847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.586","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.523913Z","title":"SegTune: Structured and fine-grained con- trol for song generation","venue":null,"work_id":"3ea9c83b-4dcb-4521-8f34-480158e20896","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.140918Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:90090f82c9ae64c364a5d3a89e9b879895f3884f120ddd06c4a7c288ed842c4e","observation_id":"ef7088ac-e0e6-4331-a5c5-bff7ee09a496","resolution":{"observed_at":"2026-08-11T14:54:55.528507Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-11T14:54:55.144842Z","title":"Qwen2.5-Omni technical report.CoRR, abs/2503.20215,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.144842Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:53067dd87e8ec249b1bd6cf806245e479abb5db3ac93b257c0deed453f14093b","observation_id":"a41bb708-5063-4773-a12d-b90f59ac082e","resolution":{"observed_at":"2026-08-11T14:54:55.144842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.020433Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":"5236cc02-ff3c-4ec9-8e9d-6b5bb1493f8c","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.153623Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:ada6c230c4c7eb3493bd33058d2fbec1341d3a43e90e8f9c89fa44971fd2750d","observation_id":"fda2e9ef-d7ff-4da9-a101-f60dad53afd7","resolution":{"observed_at":"2026-08-11T14:54:56.025058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.005904Z","title":"Audiox: A unified framework for anything-to-audio generation","venue":null,"work_id":"5a9b7f06-9986-470c-976e-5d8025cddf65","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.157870Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:f7047bfc2769c682cfaa96630e16188f8cd5c97cb494a0e86f1fc8f0f3d08dc2","observation_id":"386c4899-330e-4995-a944-fd706fcd1e3d","resolution":{"observed_at":"2026-08-11T14:54:56.010531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.989387Z","title":"Higgs Audio V2: Redefining expressiveness in audio generation","venue":null,"work_id":"8bc9118b-d096-45e4-b4fa-2e1294dc5132","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.161824Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:139bc440bbc210dda89f9825ec167f918674589ddfd69b64dd6e4adfeeea87cf","observation_id":"ddc464a5-37d5-489e-bdb3-37f041586904","resolution":{"observed_at":"2026-08-11T14:54:55.995338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.24391","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.491811Z","title":"UniFlow- Audio: Unified flow matching for audio generation from omni-modalities.CoRR, abs/2509.24391, 2025","venue":null,"work_id":"f58a04b2-7ef7-416e-8af3-bf2f8e92a991","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.165701Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:462204fbaf5619bc94fd5ef9bc8e7d852d46d7e8aa5038495a92ea439742f60f","observation_id":"4ae51aae-4b50-4398-bbf1-ffeb860a1e57","resolution":{"observed_at":"2026-08-11T14:54:55.499848Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.169530Z","title":"Supervised learning of universal sentence representations from natural language inference data","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.169530Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:fe27130f8aa593a5d98a27f7629c03cbc68a9fde10cffbab40561f59835c6733","observation_id":"955e52c4-3a3b-455c-8728-ad26f9cbfee5","resolution":{"observed_at":"2026-08-11T14:54:55.169530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-12T19:28:23.372660Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T14:54:55.173499Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.173499Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:bc991e2874da6312adae0da3a8ff3fd5f7163f6d038e801686b6f9aff7721808","observation_id":"abcac6ea-9023-46a7-83e5-f42822daecd6","resolution":{"observed_at":"2026-08-11T14:54:55.173499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.973585Z","title":"Eliminating oversaturation and artifacts of high guidance scales in diffusion models","venue":null,"work_id":"c4049769-a4c0-4e3c-af8b-549181738046","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.178905Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:f0c86f42c611ed64dfac2a42263c02a0ed9e77e60ecd9db07b54ba2f33de6f1c","observation_id":"6004f259-5b16-45c1-a7ea-f7031326e77c","resolution":{"observed_at":"2026-08-11T14:54:55.978801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-11T14:54:55.183277Z","title":"Seed-TTS: A family of high-quality versatile speech generation models.CoRR, abs/2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.183277Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:b9e985258653bd7460872bd0f75c4f4228dd6a8199e5c419c3a8adbcab30e066","observation_id":"ac4144c2-224e-423e-9d08-114090bf528a","resolution":{"observed_at":"2026-08-11T14:54:55.183277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.958161Z","title":"Librispeech-pc: Benchmark for evaluation of punc- tuation and capitalization capabilities of end-to-end asr models","venue":null,"work_id":"2069da5b-2a54-4b7d-b7ba-ac57253396d9","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.188042Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:2dd991fcd77396c66f2f1ba0ffb15d21738137fba16feb3278b173c6a334d4ae","observation_id":"371dd502-aa54-4b93-8057-8f167f221832","resolution":{"observed_at":"2026-08-11T14:54:55.963729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.944446Z","title":"AudioCaps: Generating captions for audios in the wild","venue":null,"work_id":"5505ad84-5cf8-4bdf-a3c7-37d5d71828bf","year":2019},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.192582Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:77e7846ea622671654e7ae725d0a90535d0ec74c8cf98e63f8890c226a32f10a","observation_id":"b2798beb-52d1-42af-ac10-55cdf9072415","resolution":{"observed_at":"2026-08-11T14:54:55.948849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-13T17:15:19.591196Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-11T14:54:55.196931Z","title":"Denk, Zalán Borsos, Jesse H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.196931Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:d1828f9a0acf1136c1c337e6dfb29c99be40c4e66c94f04469d54294f84cfa97","observation_id":"7f6a365e-c732-4d60-b0d2-c35994108945","resolution":{"observed_at":"2026-08-11T14:54:55.196931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-11T14:54:55.201613Z","title":"The song describer dataset: A corpus of audio captions for music-and- language evaluation.CoRR, abs/2311.10057, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.201613Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:77ef1b598617311d7bdbeaf06d90d142c5ac81d94a959d014f1900ce4f911dd5","observation_id":"b68f9f84-a28b-4284-9d43-227b77b4bca7","resolution":{"observed_at":"2026-08-11T14:54:55.201613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T14:54:55.206209Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.206209Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:91d346dc3c535e5a13f54ce66e36de827d93f6bb7917b6fb4f79001d3da6afde","observation_id":"9242d031-4e69-4b04-9d86-ddf022d84c86","resolution":{"observed_at":"2026-08-11T14:54:55.206209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.930758Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"f0edfcd9-2ae8-4b3f-bb9d-15ef94be5f5d","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.210869Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:b54ba160f63ec5a86c3e6aa1bc2a26d0903b02354372ebde11b0639c7f0acb41","observation_id":"0cb6a07a-4fb6-4c10-b20e-18cc239d67a0","resolution":{"observed_at":"2026-08-11T14:54:55.935113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.916997Z","title":"rain” may be an event in sfx, “an urban street in a downpour","venue":null,"work_id":"056e29b2-ce60-44cf-b7c5-05401dc5796e","year":2022},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.215282Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:5109cd76aca5865a5b7b240ed22215da38aa2689079df27abc466112e59836c2","observation_id":"c7d98b08-56b2-46b5-bba9-9d43b7952fa7","resolution":{"observed_at":"2026-08-11T14:54:55.921565Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.902970Z","title":"rule-based templates","venue":null,"work_id":"295a7468-acc2-43f2-ac8d-69d3e864110e","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.219349Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:270fe005930cb056846486e2d1fc3137bc92ccb33c8320d3be2763b5f802ea23","observation_id":"f7f18d1f-6b9b-4db2-b40a-3db806700a16","resolution":{"observed_at":"2026-08-11T14:54:55.907528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.888718Z","title":"Do not include markdown, explana- tions, or extra text","venue":null,"work_id":"0358bf83-f12d-48f4-b985-6fae20b4c536","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.223346Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:a19d17ec9fd3d29e870d1ade04cac786f2e51305274bb0fe7c647074d93fd1dd","observation_id":"1fa24644-4753-455f-b26b-eb41a89cd3be","resolution":{"observed_at":"2026-08-11T14:54:55.893520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.874150Z","title":"Do not add new keys","venue":null,"work_id":"b8674615-5f5d-4bba-a237-11058e227397","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.227851Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:3a13dbb9489354a0c7df2d1a19ffec9211f017d5cca31d913f510ff9539729ef","observation_id":"0010179d-e9ce-4f5e-bd02-2954138956d6","resolution":{"observed_at":"2026-08-11T14:54:55.878723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.858888Z","title":"- Do not paraphrase, expand, or rewrite it","venue":null,"work_id":"6e3924ee-d9d4-43b2-ab87-815cf105bf4d","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.231770Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:1128df9435a3281dbd4f45d6795fb770b0fefbd003f57a334479c619af6c1421","observation_id":"364a779a-e06d-4041-af44-06bacacb3304","resolution":{"observed_at":"2026-08-11T14:54:55.863503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.844435Z","title":"- Otherwise leave it empty","venue":null,"work_id":"f001676f-cac0-4cb9-aef6-bc7b36abf79c","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.235918Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:c235443a0fc179786087352c22e9e1143830d0e97992afbfd078ef0aa4ba57e5","observation_id":"28fde77a-e01a-4113-815d-914948893213","resolution":{"observed_at":"2026-08-11T14:54:55.849051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.830826Z","title":"Other- wise leave it empty","venue":null,"work_id":"0587fb4e-4ab9-4aa2-93f0-86294dbaa870","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.239775Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:f28648a627713dd85c0ccb34b1ec47afe91d7d27c89dcbb15a0cafb138612265","observation_id":"750581f5-7a9b-4b7d-be7b-b099686e335e","resolution":{"observed_at":"2026-08-11T14:54:55.834994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.817135Z","title":null,"venue":null,"work_id":"a39e9022-cef1-4105-adef-8696e70fbfda","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.243879Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:f90458cedae1e71a616c8d93a1f6bd26a348eb841dba780ac2da63f4f05d831e","observation_id":"465acee9-987c-47c6-bfc0-4dab1cd5d5c7","resolution":{"observed_at":"2026-08-11T14:54:55.821099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.803569Z","title":"- Otherwise leave it empty","venue":null,"work_id":"4a251756-f8fe-45c3-835f-9fe071df32e7","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.247581Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:8fa9315d93e3bbe0bddab0952f92e867b5602916b657726e4d110371ac6f235b","observation_id":"ace219d6-1fef-41df-969f-24e92c3f7d29","resolution":{"observed_at":"2026-08-11T14:54:55.807877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.789430Z","title":null,"venue":null,"work_id":"30570b2c-bae0-40b2-8cda-1a8c316cb71b","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.251276Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:5cfe288653ec314cbf5505ba9f5eeb3c26fbf12b9cc160037162507e1af7ddf4","observation_id":"353f1487-1fbf-4872-a937-cbd532615bd3","resolution":{"observed_at":"2026-08-11T14:54:55.794116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.773349Z","title":null,"venue":null,"work_id":"dbd95d23-26bb-4bd6-833c-d0edcb1e176f","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.254890Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:596ffc9fa586e65f54be9b4678a88693a4e8455ce7050927dab2cf4097f24b8b","observation_id":"83f9cdc4-50cd-4be2-bf37-b6357e747476","resolution":{"observed_at":"2026-08-11T14:54:55.778522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.757850Z","title":null,"venue":null,"work_id":"a124a4e1-c3e0-4cf1-b659-516edbc4a6b5","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.258634Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:cf6d898a70088ec40e192151d0292387d65766dd75a4ee3cbceb5823b54b0c6c","observation_id":"6330a75d-ffd2-4610-a6f9-473999d3b4e5","resolution":{"observed_at":"2026-08-11T14:54:55.762312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.743210Z","title":null,"venue":null,"work_id":"daa0893d-53e4-4749-9cc0-29f5e39c4729","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.262758Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:4c97db4bbd971303eb7ad62ee117c8a2353e83584763d85f1a8b730b6a097005","observation_id":"889cc983-b815-4dd9-a3e1-56cfdcf16dad","resolution":{"observed_at":"2026-08-11T14:54:55.747826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.729930Z","title":"1\", \"2\",","venue":null,"work_id":"07935f21-c035-4965-8781-30e85ef7a366","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.267346Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:dcbd40155d856252f0f67f6fe5616cb52df53a7c38de660431459f20f3f56e9f","observation_id":"4c9b4f35-0a32-4976-af3c-7a1910d000f2","resolution":{"observed_at":"2026-08-11T14:54:55.733866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.716248Z","title":null,"venue":null,"work_id":"e3c1714a-b557-425b-987b-3e0afcb2e460","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.271550Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:50cecb8c94aec20ee43b62f625e2e94b778a2bece2332d1428518db53c8e4bb3","observation_id":"4038b4a8-cdc6-468c-835d-7d4d25138f2f","resolution":{"observed_at":"2026-08-11T14:54:55.720592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.701813Z","title":"summary\":","venue":null,"work_id":"5512078b-b456-4363-b404-d03cd2f220f3","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.275856Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:c9e3b0879bf49eb9c430a97dcc2f75d0d3bc473095ad67a1cc046df66357d0fe","observation_id":"0d1a757a-e876-4dc8-b70c-6f66be8fce40","resolution":{"observed_at":"2026-08-11T14:54:55.706330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-13T04:54:07.077274Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T14:54:55.062732Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.062732Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:ee9479fda91526ffc9ee2e046980e4ed8415c59a792cea85f1f1dffe9bc20cdc","observation_id":"57e5ad33-fe50-4da2-b06f-b3c4ed53a099","resolution":{"observed_at":"2026-08-11T14:54:55.062732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-11T14:54:55.149373Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.149373Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:e8c83845108a3c06c582604228af7d1ba476d51f48a1bac60312f525046bccdd","observation_id":"d2ee54d8-1f0b-469a-98b8-2ae550ef66e5","resolution":{"observed_at":"2026-08-11T14:54:55.149373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T17:22:19.387297Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":3,"verified_fuzzy":30},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2608.09571."}