{"as_of":"2026-08-06T14:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d22b7872ba434d6cf7e6d9138d5e442c6c2526cea8fb2b90a63139e6a821f5f","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T07:33:35.243337Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:35:57.951684Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T23:59:06.152150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"cited_work":{"arxiv_id":"2605.18749","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18749","snapshot_observed_at":"2026-07-03T23:59:06.152150Z","title":"WavFlow: Audio Generation in Waveform Space","venue":"cs.SD","work_id":"2af0404a-fef6-425b-8bf4-6e6be7f10f19","year":2026},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2605.18749","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:e86cb405740fb9992d4bd8d84640447cbdf85e78fd69a9ca706e7a07b958b8da","observation_id":"e5cae9bd-857c-4e23-a9c4-45a53ee50618","resolution":{"observed_at":"2026-07-02T05:16:39.834936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"cited_work":{"arxiv_id":"2605.18749","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18749","snapshot_observed_at":"2026-07-03T23:59:06.152150Z","title":"WavFlow: Audio Generation in Waveform Space","venue":"cs.SD","work_id":"2af0404a-fef6-425b-8bf4-6e6be7f10f19","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-08-05T20:35:27.953841Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T14:40:40.673091Z"},"links":{"cited_paper":"/paper/2605.18749","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:491f18234ee446d43598173397da3fdf047cc226bc27bb278d4dbf32b9b581a3","observation_id":"80569202-9d63-4260-8b9b-9c13893c1951","resolution":{"observed_at":"2026-07-03T03:47:35.727876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"cited_work":{"arxiv_id":"2605.18749","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18749","snapshot_observed_at":"2026-07-03T23:59:06.152150Z","title":"WavFlow: Audio Generation in Waveform Space","venue":"cs.SD","work_id":"2af0404a-fef6-425b-8bf4-6e6be7f10f19","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-08-05T20:35:27.953841Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2605.18749","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:4aa868f83b511afc535bc39bf9ae9498930d738b5919bad3b9a6df069d7bd97e","observation_id":"316c97cf-0705-4025-bcf8-747a28f89ecb","resolution":{"observed_at":"2026-07-03T23:59:06.154351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18749","snapshot_observed_at":"2026-08-03T08:35:57.951684Z","title":"Wavflow: Audio generation in waveform space.arXiv preprint arXiv:2605.18749, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T23:15:08.967026Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:57.951684Z"},"links":{"cited_paper":"/paper/2605.18749","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:d1c9d81d8fa1ab5965ae20bdb279e8206d8e936ca2e0bedb35f6a1b2b3464149","observation_id":"4881eed1-09ce-49b7-8673-4b867bc4581d","resolution":{"observed_at":"2026-08-03T08:35:57.951684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.18749/citation-record","integrity":"/paper/2605.18749/integrity","json":"/paper/2605.18749/citation-record.json","paper":"/paper/2605.18749"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.15571","last_updated":"2023-03-09T15:18:40Z","snapshot_observed_at":"2026-07-06T13:58:18.393526Z","submitted_at":"2022-09-30T16:30:31Z","title":"Building Normalizing Flows with Stochastic Interpolants","version":3},"cited_work":{"arxiv_id":"2209.15571","doi":"10.1093/mnras/staf336","metadata_source":"pith","pith_arxiv_id":"2209.15571","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Building Normalizing Flows with Stochastic Interpolants","venue":"cs.LG","work_id":"83654cbd-832b-4269-bec9-26faa87ececd","year":2022},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2209.15571","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:22f9c3aaf499251268979a24304316eb68656b339961c281d81f352832007b17","observation_id":"4e3d6786-c486-47df-b114-888464f2b280","resolution":{"observed_at":"2026-05-20T07:38:09.644031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T20:49:09.239152+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T20:49:09.239152+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07963","last_updated":"2025-04-10T17:59:56Z","snapshot_observed_at":"2026-08-04T06:26:36.498042Z","submitted_at":"2025-04-10T17:59:56Z","title":"PixelFlow: Pixel-Space Generative Models with Flow","version":1},"cited_work":{"arxiv_id":"2504.07963","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07963","snapshot_observed_at":"2026-07-04T20:50:11.498748Z","title":"arXiv preprint arXiv:2504.07963 (2025)","venue":null,"work_id":"1beb1a44-0887-4a87-93c8-5dca148563bd","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2504.07963","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:a7381e6931544f26099043c4f90bd7e4ebcc36ade3fb415e09de286395dc6f8f","observation_id":"971fff5d-7441-4db5-b29d-9003b0f09df4","resolution":{"observed_at":"2026-05-20T07:38:09.607423Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10972","last_updated":"2023-05-21T07:07:55Z","snapshot_observed_at":"2026-07-06T14:44:45.326057Z","submitted_at":"2023-01-26T07:37:22Z","title":"On the Importance of Noise Scheduling for Diffusion Models","version":4},"cited_work":{"arxiv_id":"2301.10972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.10972","snapshot_observed_at":"2026-07-07T18:04:00.522746Z","title":"On the importance of noise scheduling for diffu- sion models","venue":"cs.CV","work_id":"1783cbc7-505c-4ebc-82f3-86877ef131b3","year":2023},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2301.10972","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:364cdada68e83b14f018c2290af94fea4b7b579e6e705423638e4fb25c45a764","observation_id":"06291588-0bab-4846-8a8d-f6ee539c0426","resolution":{"observed_at":"2026-05-20T07:38:09.602797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02731","last_updated":"2026-04-29T02:44:11Z","snapshot_observed_at":"2026-07-06T22:40:46.465095Z","submitted_at":"2026-01-06T05:49:41Z","title":"Omni2Sound: Towards Unified Video-Text-to-Audio Generation","version":3},"cited_work":{"arxiv_id":"2601.02731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.02731","snapshot_observed_at":"2026-07-02T04:56:39.401500Z","title":"Omni2Sound: Towards Unified Video-Text-to-Audio Generation","venue":"cs.SD","work_id":"feb70c55-8e33-41a3-a166-be9212d10995","year":2026},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2601.02731","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:318fd0400b4b908024c7db6617df83392d011da38a6eedbb986a193fb5cc0a60","observation_id":"6874acd5-e693-4261-ac39-90e1c5d009a0","resolution":{"observed_at":"2026-05-20T07:38:09.651919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:7f08e9b98bf64ab593bb1da033ece54d618824343306998e439fc183f054bd45","observation_id":"e7cd9461-3a1f-40dd-aa43-d32da6ec4789","resolution":{"observed_at":"2026-05-20T07:38:09.586521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EBU R 128: Loudness normalisation and permitted maximum level of audio signals","venue":null,"work_id":"8b080c33-94cd-49d8-854f-2f8b8025a93b","year":2020},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:a8ad5dc74c38394e82f0904647671fd2d9053219fe157b00c51e894ab54fec35","observation_id":"92a9bd16-7a37-477e-8c25-022807c7f09c","resolution":{"observed_at":"2026-05-20T08:33:25.719278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19324","last_updated":"2025-03-22T19:42:20Z","snapshot_observed_at":"2026-07-06T19:39:33.077694Z","submitted_at":"2024-10-25T06:20:06Z","title":"Simpler Diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion","version":2},"cited_work":{"arxiv_id":"2410.19324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19324","snapshot_observed_at":"2026-07-07T18:04:00.512591Z","title":"Simpler diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion","venue":"cs.CV","work_id":"745ef26a-c245-4843-a44d-629a12795773","year":2024},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2410.19324","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:73b8ed630025dc1d5a8e44cd18392c340b60011d64b583cba492ed086ec69aa9","observation_id":"bc6b42d8-f5be-47b5-9754-579e0f400a65","resolution":{"observed_at":"2026-05-20T07:38:09.582938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"7710f457-409e-4708-a163-e6ccad9d341a","year":2019},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:dac320b6fb3f971fa8b4908ff85fad235f53cd45220d8d7fe0af8b4ca43322dd","observation_id":"d3d20bc3-32bb-44d2-97bf-94a1dda14fb3","resolution":{"observed_at":"2026-05-20T08:33:25.716717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":"2009.09761","doi":"10.48550/arxiv.2009.09761","metadata_source":"pith","pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","venue":"eess.AS","work_id":"042bbb99-f912-4aa4-aa7a-252c7b6379a8","year":2020},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:c0a8cc7736e3130f78c8b15d19497d60dc26b2aa95aa811ce586a0de36fcb7cf","observation_id":"b7812fb5-f588-43bb-b89b-646d98a5c3aa","resolution":{"observed_at":"2026-05-20T07:38:09.657687Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-03T05:48:47.605109Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:f45688485265cf275ff934eb858d3c00535c078bf4281c356ad89244672141c2","observation_id":"311d23eb-a810-499c-a0a7-241c32dba0f2","resolution":{"observed_at":"2026-05-20T07:38:09.638265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:adfb74e0853cd2cf3a658f50fd676e6ac5abf1680af3ba4f4e2829aacafd7aa3","observation_id":"3662da70-f9dc-47ec-9904-b88ea400f5ca","resolution":{"observed_at":"2026-05-20T07:38:09.595548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13720","last_updated":"2026-01-07T05:36:57Z","snapshot_observed_at":"2026-07-06T22:36:08.495952Z","submitted_at":"2025-11-17T18:59:57Z","title":"Back to Basics: Let Denoising Generative Models Denoise","version":2},"cited_work":{"arxiv_id":"2511.13720","doi":"10.48550/arxiv.2511.13720","metadata_source":"pith","pith_arxiv_id":"2511.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Back to Basics: Let Denoising Generative Models Denoise","venue":"cs.CV","work_id":"37973de8-a5e6-4d92-897b-a98fa9f7f2f3","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2511.13720","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:3d0932fc50e1c982e1c595389653ea3edb846afc1a80e1549798c522e0db717d","observation_id":"5bdff814-cef3-41be-ba20-3e40712fd059","resolution":{"observed_at":"2026-05-20T07:38:09.660748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:b8d9dc872117fcac5f9733a0dd26170e37445c4a5a1a448aaf05e15070409820","observation_id":"e76a7954-5d12-4ee0-b3dd-fcfac42df3dc","resolution":{"observed_at":"2026-05-20T07:38:09.671175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-04T06:05:54.694240Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":"2301.12503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-07-04T11:59:50.469153Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"b44ebce5-47f1-4f14-b13b-b5b4eb072d2c","year":2023},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:416b6219eaf5bc793ceb3d90a550be831a84b4617701ef90649d38e5f238e2eb","observation_id":"875fd0db-094b-4cac-a577-9f4e223b7d81","resolution":{"observed_at":"2026-05-20T07:38:09.626883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:16:12.347707Z","title":"Thinksound: Chain-of-thought reasoning in multimodal large language models for audio generation and editing","venue":null,"work_id":"749540a7-f56f-46e1-a8ef-a27209f59b05","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:bd7ec8121dfd83e51dccd935c27a12d0cd6e3e87a9b4a450f5029f654d1a9827","observation_id":"8f68feeb-e8e9-4f19-ad0e-115e0fc7a1aa","resolution":{"observed_at":"2026-05-20T07:38:09.623197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:8429ec65bf04822f83ef02dcfb51b2c66c14bc07b99a35dbe96164ce6b7352c7","observation_id":"9fb1632d-4f62-4a53-8e29-bc512c6e2ebf","resolution":{"observed_at":"2026-05-20T07:38:09.632947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:0ce3b886013e837a1bbd64ffda88fd23d8d3b60821a7731452d0bf4269b61242","observation_id":"742d9f7c-30d9-4792-8667-8b9f3788b881","resolution":{"observed_at":"2026-05-20T07:38:09.679735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-08-05T17:16:27.324589Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":"2508.16930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-07-02T04:56:39.439125Z","title":"Hunyuanvideo-foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation","venue":null,"work_id":"c52cc69a-842a-4c11-873a-e3d9aaaeb3de","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:4a432474683e5b004a5494765dac1e8ef54b75cb798b11640caf53ebc4527d82","observation_id":"8032a2de-dcc9-4af8-8284-93c79b41b522","resolution":{"observed_at":"2026-05-20T07:38:09.613488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":"2503.10522","doi":"10.48550/arxiv.2503.10522","metadata_source":"pith","pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","venue":"cs.MM","work_id":"ec79607c-bea2-4879-85ed-00db057adcc7","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:c55b8e80481f42a02de906042240bce004d0c0da601c9d4905486ec24bc934de","observation_id":"63d534b9-ecf6-4c69-9f52-d0a171cac56f","resolution":{"observed_at":"2026-05-20T07:38:09.667596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":"2502.05139","doi":"10.48550/arxiv.2502.05139","metadata_source":"pith","pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","venue":"cs.SD","work_id":"7cba92d8-f51e-4a64-8d1d-6d4cf1f56377","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:e460abfb4baae075f56b2d5cb4c707dd9ea436772f5b18bd60181c7722c53352","observation_id":"5fee23b3-f282-4f5c-a00e-891897b2ac23","resolution":{"observed_at":"2026-05-20T07:38:09.598655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:6f4e5559780a0599035064320c6da488c691e80862ef78ee196858cf436c043f","observation_id":"e2a36026-9d6a-405a-a00d-fa7e1bbc709a","resolution":{"observed_at":"2026-05-20T07:38:09.648205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporally aligned audio for video with autoregression","venue":null,"work_id":"65105b0a-42bf-4c3e-9df7-afdecc460384","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:f71ff02e254c69e1499cdf3a1f9bec14a1d48e8850aee6da441ad7c76d61ef35","observation_id":"7e34c4af-94cb-4720-98d3-aab9904f13e0","resolution":{"observed_at":"2026-05-20T08:33:25.722407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T14:47:03.168926Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models","venue":null,"work_id":"709d7ef2-3738-4756-a913-5a769f47acde","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:3c9114d8279cf37ebb0fab4bbb24095b85a794fb08958ab9fb5152dd64f160fc","observation_id":"45ba02d6-961c-4f4f-a0fb-f445f32c4df5","resolution":{"observed_at":"2026-05-20T07:38:09.617473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:5e73cdb1ee92583584cbcc1d08840c073e6185e30a131e4ef8e879c9a8cb22aa","observation_id":"cbe99739-6516-4af1-a22b-213752dd6fc6","resolution":{"observed_at":"2026-05-20T07:38:09.675325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M” and “L","venue":null,"work_id":"e3d79c57-8999-4fa1-8324-a241a10809df","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:54bd2a82a8c1501b8f0eb5b9908b8825e0112a7745dc1488194cbebce182d93d","observation_id":"b98a9bc3-9663-4cdb-892c-008024e02984","resolution":{"observed_at":"2026-05-20T08:33:25.714017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-source T2A","venue":null,"work_id":"00a0eeca-3736-4dde-9526-1c8842e7edad","year":2016},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:732e68a89e7e5a193d9bf67a4acc6f42d50813a34a3ce2967f71368469335dd0","observation_id":"5999fa2f-2963-4b0d-941b-14178d9a805f","resolution":{"observed_at":"2026-05-20T08:33:25.711539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0012.5120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"252e7d96-d81d-4fe9-823f-68d9297ee28a","year":2025},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:a0457d7f169388598139d27bb1c0b30bbff640c204410c1756fdcfdef11f66a8","observation_id":"75eb229a-33f0-46e9-8b7f-99fbbb7aa4ac","resolution":{"observed_at":"2026-05-20T07:38:09.590209Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":5},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 4 inbound Pith citation observations for arXiv:2605.18749."}