Pith. sign in

Paper Citation Record · LEDGER

WavFlow: Audio Generation in Waveform Space

As of 6 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 4 inbound Pith citation observations for arXiv:2605.18749.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.18749 v1

Coverage vector

measured 27 of 27 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-20T07:33:35.243337Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T08:35:57.951684Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-03T23:59:06.152150Z

Reference resolution

27 of 27 outbound references displayed

  • verified exact18
  • verified fuzzy5
  • unresolved0
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch3

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4e3d6786-c486-47df-b114-888464f2b280 · outbound

This paper cites Building Normalizing Flows with Stochastic Interpolants.

WavFlow: Audio Generation in Waveform Space Building Normalizing Flows with Stochastic Interpolants

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.644031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:22f9c3aaf499251268979a24304316eb68656b339961c281d81f352832007b17

Observation 971fff5d-7441-4db5-b29d-9003b0f09df4 · outbound

This paper cites PixelFlow: Pixel-Space Generative Models with Flow.

WavFlow: Audio Generation in Waveform Space PixelFlow: Pixel-Space Generative Models with Flow

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T07:38:09.607423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:a7381e6931544f26099043c4f90bd7e4ebcc36ade3fb415e09de286395dc6f8f

Observation 06291588-0bab-4846-8a8d-f6ee539c0426 · outbound

This paper cites On the Importance of Noise Scheduling for Diffusion Models.

WavFlow: Audio Generation in Waveform Space On the Importance of Noise Scheduling for Diffusion Models

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:38:09.602797Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:364cdada68e83b14f018c2290af94fea4b7b579e6e705423638e4fb25c45a764

Observation 6874acd5-e693-4261-ac39-90e1c5d009a0 · outbound

This paper cites Omni2Sound: Towards Unified Video-Text-to-Audio Generation.

WavFlow: Audio Generation in Waveform Space Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.651919Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:318fd0400b4b908024c7db6617df83392d011da38a6eedbb986a193fb5cc0a60

Observation e7cd9461-3a1f-40dd-aa43-d32da6ec4789 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

WavFlow: Audio Generation in Waveform Space An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.586521Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:7f08e9b98bf64ab593bb1da033ece54d618824343306998e439fc183f054bd45

Observation 92a9bd16-7a37-477e-8c25-022807c7f09c · outbound

This paper cites EBU R 128: Loudness normalisation and permitted maximum level of audio signals.

WavFlow: Audio Generation in Waveform Space EBU R 128: Loudness normalisation and permitted maximum level of audio signals

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T08:33:25.719278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:a8ad5dc74c38394e82f0904647671fd2d9053219fe157b00c51e894ab54fec35

Observation bc6b42d8-f5be-47b5-9754-579e0f400a65 · outbound

This paper cites Simpler Diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion.

WavFlow: Audio Generation in Waveform Space Simpler Diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:38:09.582938Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:73b8ed630025dc1d5a8e44cd18392c340b60011d64b583cba492ed086ec69aa9

Observation d3d20bc3-32bb-44d2-97bf-94a1dda14fb3 · outbound

This paper cites Audiocaps: Generating captions for audios in the wild.

WavFlow: Audio Generation in Waveform Space Audiocaps: Generating captions for audios in the wild

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T08:33:25.716717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:dac320b6fb3f971fa8b4908ff85fad235f53cd45220d8d7fe0af8b4ca43322dd

Observation b7812fb5-f588-43bb-b89b-646d98a5c3aa · outbound

This paper cites DiffWave: A Versatile Diffusion Model for Audio Synthesis.

WavFlow: Audio Generation in Waveform Space DiffWave: A Versatile Diffusion Model for Audio Synthesis

Reference 9

Resolution
metadata mismatch
local_arxiv, observed 2026-05-20T07:38:09.657687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:c0a8cc7736e3130f78c8b15d19497d60dc26b2aa95aa811ce586a0de36fcb7cf

Observation 311d23eb-a810-499c-a0a7-241c32dba0f2 · outbound

This paper cites AudioGen: Textually Guided Audio Generation.

WavFlow: Audio Generation in Waveform Space AudioGen: Textually Guided Audio Generation

Reference 10

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T07:38:09.638265Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:f45688485265cf275ff934eb858d3c00535c078bf4281c356ad89244672141c2

Observation 3662da70-f9dc-47ec-9904-b88ea400f5ca · outbound

This paper cites BigVGAN: A Universal Neural Vocoder with Large-Scale Training.

WavFlow: Audio Generation in Waveform Space BigVGAN: A Universal Neural Vocoder with Large-Scale Training

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:38:09.595548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:adfb74e0853cd2cf3a658f50fd676e6ac5abf1680af3ba4f4e2829aacafd7aa3

Observation 5bdff814-cef3-41be-ba20-3e40712fd059 · outbound

This paper cites Back to Basics: Let Denoising Generative Models Denoise.

WavFlow: Audio Generation in Waveform Space Back to Basics: Let Denoising Generative Models Denoise

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.660748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:3d0932fc50e1c982e1c595389653ea3edb846afc1a80e1549798c522e0db717d

Observation e76a7954-5d12-4ee0-b3dd-fcfac42df3dc · outbound

This paper cites Flow Matching for Generative Modeling.

WavFlow: Audio Generation in Waveform Space Flow Matching for Generative Modeling

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.671175Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:b8d9dc872117fcac5f9733a0dd26170e37445c4a5a1a448aaf05e15070409820

Observation 875fd0db-094b-4cac-a577-9f4e223b7d81 · outbound

This paper cites AudioLDM: Text-to-Audio Generation with Latent Diffusion Models.

WavFlow: Audio Generation in Waveform Space AudioLDM: Text-to-Audio Generation with Latent Diffusion Models

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:38:09.626883Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:416b6219eaf5bc793ceb3d90a550be831a84b4617701ef90649d38e5f238e2eb

Observation 8f68feeb-e8e9-4f19-ad0e-115e0fc7a1aa · outbound

This paper cites Thinksound: Chain-of-thought reasoning in multimodal large language models for audio generation and editing.

WavFlow: Audio Generation in Waveform Space Thinksound: Chain-of-thought reasoning in multimodal large language models for audio generation and editing

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:38:09.623197Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:bd7ec8121dfd83e51dccd935c27a12d0cd6e3e87a9b4a450f5029f654d1a9827

Observation 9fb1632d-4f62-4a53-8e29-bc512c6e2ebf · outbound

This paper cites Movie Gen: A Cast of Media Foundation Models.

WavFlow: Audio Generation in Waveform Space Movie Gen: A Cast of Media Foundation Models

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.632947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:8429ec65bf04822f83ef02dcfb51b2c66c14bc07b99a35dbe96164ce6b7352c7

Observation 742d9f7c-30d9-4792-8667-8b9f3788b881 · outbound

This paper cites Progressive Distillation for Fast Sampling of Diffusion Models.

WavFlow: Audio Generation in Waveform Space Progressive Distillation for Fast Sampling of Diffusion Models

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.679735Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:0ce3b886013e837a1bbd64ffda88fd23d8d3b60821a7731452d0bf4269b61242

Observation 8032a2de-dcc9-4af8-8284-93c79b41b522 · outbound

This paper cites HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation.

WavFlow: Audio Generation in Waveform Space HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:38:09.613488Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:4a432474683e5b004a5494765dac1e8ef54b75cb798b11640caf53ebc4527d82

Observation 63d534b9-ecf6-4c69-9f52-d0a171cac56f · outbound

This paper cites AudioX: A Unified Framework for Anything-to-Audio Generation.

WavFlow: Audio Generation in Waveform Space AudioX: A Unified Framework for Anything-to-Audio Generation

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.667596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:c55b8e80481f42a02de906042240bce004d0c0da601c9d4905486ec24bc934de

Observation 5fee23b3-f282-4f5c-a00e-891897b2ac23 · outbound

This paper cites Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound.

WavFlow: Audio Generation in Waveform Space Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.598655Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:e460abfb4baae075f56b2d5cb4c707dd9ea436772f5b18bd60181c7722c53352

Observation e2a36026-9d6a-405a-a00d-fa7e1bbc709a · outbound

This paper cites WaveNet: A Generative Model for Raw Audio.

WavFlow: Audio Generation in Waveform Space WaveNet: A Generative Model for Raw Audio

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.648205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:6f4e5559780a0599035064320c6da488c691e80862ef78ee196858cf436c043f

Observation 7e34c4af-94cb-4720-98d3-aab9904f13e0 · outbound

This paper cites Temporally aligned audio for video with autoregression.

WavFlow: Audio Generation in Waveform Space Temporally aligned audio for video with autoregression

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T08:33:25.722407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:f71ff02e254c69e1499cdf3a1f9bec14a1d48e8850aee6da441ad7c76d61ef35

Observation 45ba02d6-961c-4f4f-a0fb-f445f32c4df5 · outbound

This paper cites V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models.

WavFlow: Audio Generation in Waveform Space V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:38:09.617473Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:3c9114d8279cf37ebb0fab4bbb24095b85a794fb08958ab9fb5152dd64f160fc

Observation cbe99739-6516-4af1-a22b-213752dd6fc6 · outbound

This paper cites Qwen3-Omni Technical Report.

WavFlow: Audio Generation in Waveform Space Qwen3-Omni Technical Report

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-20T07:38:09.675325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:5e73cdb1ee92583584cbcc1d08840c073e6185e30a131e4ef8e879c9a8cb22aa

Observation b98a9bc3-9663-4cdb-892c-008024e02984 · outbound

This paper cites M” and “L.

WavFlow: Audio Generation in Waveform Space M” and “L

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T08:33:25.714017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:54bd2a82a8c1501b8f0eb5b9908b8825e0112a7745dc1488194cbebce182d93d

Observation 5999fa2f-2963-4b0d-941b-14178d9a805f · outbound

This paper cites Open-source T2A.

WavFlow: Audio Generation in Waveform Space Open-source T2A

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-20T08:33:25.711539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:732e68a89e7e5a193d9bf67a4acc6f42d50813a34a3ce2967f71368469335dd0

Observation 75eb229a-33f0-46e9-8b7f-99fbbb7aa4ac · outbound

This paper cites an unresolved cited work.

WavFlow: Audio Generation in Waveform Space Unresolved cited work

Reference 27

Resolution
malformed identifier
arxiv_id, observed 2026-05-20T07:38:09.590209Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-20T07:33:35.243337Z digest=sha256:a0457d7f169388598139d27bb1c0b30bbff640c204410c1756fdcfdef11f66a8

Pith citing papers

Observation e5cae9bd-857c-4e23-a9c4-45a53ee50618 · inbound

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling cites this paper.

WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling WavFlow: Audio Generation in Waveform Space

Reference 105

Resolution
verified exact
local_arxiv, observed 2026-07-02T05:16:39.834936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-28T08:18:42.002083Z digest=sha256:e86cb405740fb9992d4bd8d84640447cbdf85e78fd69a9ca706e7a07b958b8da

Observation 80569202-9d63-4260-8b9b-9c13893c1951 · inbound

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling cites this paper.

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling WavFlow: Audio Generation in Waveform Space

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-07-03T03:47:35.727876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T14:40:40.673091Z digest=sha256:491f18234ee446d43598173397da3fdf047cc226bc27bb278d4dbf32b9b581a3

Observation 316c97cf-0705-4025-bcf8-747a28f89ecb · inbound

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling cites this paper.

LLM can Read Spectrogram: Encoder-free Speech-Language Modeling WavFlow: Audio Generation in Waveform Space

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-07-03T23:59:06.154351Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-07-03T23:55:11.698728Z digest=sha256:4aa868f83b511afc535bc39bf9ae9498930d738b5919bad3b9a6df069d7bd97e

Observation 4881eed1-09ce-49b7-8673-4b867bc4581d · inbound

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens cites this paper.

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens WavFlow: Audio Generation in Waveform Space

Reference 125

Resolution
unresolved
no resolver link, observed 2026-08-03T08:35:57.951684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T08:35:57.951684Z digest=sha256:d1c9d81d8fa1ab5965ae20bdb279e8206d8e936ca2e0bedb35f6a1b2b3464149