{"as_of":"2026-08-17T02:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:412402a37a28ebcdcd1a75ef32607e729d91a0b45761164d05ba98bb802ba6b8","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:59:28.185416Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12951/citation-record","integrity":"/paper/2608.12951/integrity","json":"/paper/2608.12951/citation-record.json","paper":"/paper/2608.12951"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:27.737605Z","title":"Make-an-audio: Text-to-audio generation with prompt- enhanced diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.737605Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:489e87a52bc613abdd34ade2f4063c07aa720a79c275bfd0220448bf1814857c","observation_id":"9672533c-2900-4e73-bf11-ffdb694aaf54","resolution":{"observed_at":"2026-08-15T19:59:27.737605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-15T19:59:27.743079Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.743079Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:9c1a23e61b6b48a7fec785248527d6a4964b452aeee77476ddef4b7ea4880d4a","observation_id":"a4b9f80f-36c2-4ce0-9b96-eab77a1aabbc","resolution":{"observed_at":"2026-08-15T19:59:27.743079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-15T19:59:27.748642Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.748642Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:c3a78e306a3cf92785e071166dd3176f30dd5c90f4cec91edc0aa72d3ad15fce","observation_id":"207557e9-24ec-461c-bbb6-0a732429bc3f","resolution":{"observed_at":"2026-08-15T19:59:27.748642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:27.754377Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.754377Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:a3a185829c2e31a8f68d7afa5372062d76911d66d0c44fa9ffc346fe10997867","observation_id":"4387e8ab-111e-4a94-a289-b587784c521e","resolution":{"observed_at":"2026-08-15T19:59:27.754377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-15T19:59:27.763914Z","title":"Uniaudio: An audio foundation model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.763914Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:86806f9f47e45d6e609ca453cadb17680f46eb6c78e5da65ab9a793cb4dd3a9f","observation_id":"85a6239e-927e-4b97-a397-a64ac48bcab1","resolution":{"observed_at":"2026-08-15T19:59:27.763914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-16T14:31:42.162436Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-15T19:59:27.785493Z","title":"Audiobox: Unified audio gener- ation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.785493Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:3467c3acbdc952355ce3d03794baad8b75d55ba81e3d882de681f1ad37d10a5b","observation_id":"d5d7220c-6f7b-4fc1-92d5-a9c9ae5d514e","resolution":{"observed_at":"2026-08-15T19:59:27.785493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27838","last_updated":"2026-05-27T01:50:29Z","snapshot_observed_at":"2026-08-13T15:35:37.691793Z","submitted_at":"2026-05-27T01:50:29Z","title":"Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27838","snapshot_observed_at":"2026-08-15T19:59:27.831547Z","title":"Dasheng audiogen: A unified model for generating coherent audio scenes from text,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.831547Z"},"links":{"cited_paper":"/paper/2605.27838","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:bbaba67e5b66ec657ad98338146307860f0ec78b21c71b3c9fe60ceceb9f74b5","observation_id":"93765a81-b0ca-4fe5-91bc-dddd88b5959a","resolution":{"observed_at":"2026-08-15T19:59:27.831547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16117","snapshot_observed_at":"2026-08-15T19:59:27.851577Z","title":"Diffusionnft: Online diffusion reinforcement with forward process,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.851577Z"},"links":{"cited_paper":"/paper/2509.16117","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:4b0ef4fc6c67a7ba74696a4bce4f32740ba14b024df4a1c2b388ccf9d832e007","observation_id":"aec89b44-9c54-48c2-9f3d-cd637c4d0ea0","resolution":{"observed_at":"2026-08-15T19:59:27.851577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-16T15:28:43.775568Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-15T19:59:27.902369Z","title":"Make-an-audio 2: Temporal-enhanced text-to- audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.902369Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:3ad5e47d6e51bb6503ebc9e120c11e519d50f3c22790234a00161668a01dba6e","observation_id":"6f4ee8d5-f4cd-458a-bdd3-7c872f719059","resolution":{"observed_at":"2026-08-15T19:59:27.902369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:27.908184Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.908184Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:f9d9c69c7d63cf1b84536203057c09520ff9ba1b9f78e6c6c19c93f78619ca4d","observation_id":"46d04179-0680-4767-b39e-7f675c76f47d","resolution":{"observed_at":"2026-08-15T19:59:27.908184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-15T19:59:27.912849Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.912849Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:8458050468e0d9df5c99660c3d8ec8c1ea7f3ea71a5aa4b802b553197d38e1d4","observation_id":"0098b65d-aebd-41f6-95de-d804a312b0de","resolution":{"observed_at":"2026-08-15T19:59:27.912849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10819","last_updated":"2025-06-19T04:44:02Z","snapshot_observed_at":"2026-08-16T13:17:59.136118Z","submitted_at":"2024-09-17T01:27:28Z","title":"EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10819","snapshot_observed_at":"2026-08-15T19:59:27.917909Z","title":"Ezaudio: Enhancing text-to-audio generation with efficient diffusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.917909Z"},"links":{"cited_paper":"/paper/2409.10819","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:877a540b8fd5518842bd5304d2cdee79de8e7e3b20ae2987b8e8b876fe0b1815","observation_id":"703f43e4-0dd6-47ff-ac98-e9c8560680f6","resolution":{"observed_at":"2026-08-15T19:59:27.917909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.658519Z","title":"Stable audio open,","venue":null,"work_id":"58f62ed0-8288-4cff-a966-518b07b571c4","year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.922810Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:3739dd488819408f73dc86ebd793aed45ebc2c486c4f24e774f2475a2bf9d5b0","observation_id":"832cc07c-bdf3-4b29-b0a0-36c2bb73b611","resolution":{"observed_at":"2026-08-15T19:59:29.663831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:27.927761Z","title":"Mmaudio: Taming multimodal joint training for high- quality video-to-audio synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.927761Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:5231fcf2a11afc0b861af789ad2cb3083a95ce8bac73c0aa6b23dd0c8cb15b12","observation_id":"4747fb0d-534b-4f98-9c60-4397cd3c608f","resolution":{"observed_at":"2026-08-15T19:59:27.927761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-15T19:59:27.932491Z","title":"Audiox: Diffusion transformer for anything-to-audio generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.932491Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:5b04720e4b27f6b3e9c108e7c1aacadc7ab4d1d06fb0d3b459403c27c3b1ab5d","observation_id":"45671c5d-729c-4b2f-9311-fd5655d35707","resolution":{"observed_at":"2026-08-15T19:59:27.932491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-15T19:59:27.937455Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.937455Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:a000dc78c4bbda1dc663cff87a2a2668b62636465e2876f1d20122af92f7b41f","observation_id":"a25dad6e-f566-4d06-bebc-ffb4c48e1d72","resolution":{"observed_at":"2026-08-15T19:59:27.937455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:27.943160Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.943160Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:6e5dadf7eeb68bdc2c32bf72ad350b90102ce13225f9aaf973f4cd14607f15c1","observation_id":"5cb84e5d-54e2-42f3-92a6-71ffd13150fd","resolution":{"observed_at":"2026-08-15T19:59:27.943160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-16T14:12:35.270314Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-15T19:59:27.948142Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.948142Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:5e3a73eb464207402c55ca00415bd1b9cacd71f6bb68a9f7d15a87ae30f9fa7f","observation_id":"2beaf4cd-24d5-4291-bbdc-1d2f90e24be1","resolution":{"observed_at":"2026-08-15T19:59:27.948142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:27.953209Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.953209Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:1c4dd1d4e49807ebdb48cbdb5d0558aafd282dba259479f22ad3d5ffd4dcf58e","observation_id":"62f664d0-1168-4fc1-a8ad-4db1a983aec4","resolution":{"observed_at":"2026-08-15T19:59:27.953209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-15T19:59:27.958086Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.958086Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:592a48ca664cadd2827a3442ed57b817939009198a4656b3e20715be7c6346b0","observation_id":"dfd7a58c-6806-4fd3-ad39-28cbe7446353","resolution":{"observed_at":"2026-08-15T19:59:27.958086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-15T19:59:27.963256Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.963256Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:0e5210763a127be358b811de676104d5d5c47471863cd53b29c7d4a4ea0f2be8","observation_id":"d034211d-1497-4203-8935-b689d20a470c","resolution":{"observed_at":"2026-08-15T19:59:27.963256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-15T19:59:27.968462Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.968462Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:22d2c4c8e4c24eb18a28a440edb65cf40cb2358a258ebbb3def0b6f990e8e0c7","observation_id":"f0c5aa2d-014c-4794-ada7-72b7a84465f9","resolution":{"observed_at":"2026-08-15T19:59:27.968462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:27.973803Z","title":"Ditar: Diffusion transformer autoregressive modeling for speech generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.973803Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:41d857687a71bcdde22b5b99347c287113fe3630c2fd0a877c6d87217c65bfbb","observation_id":"db15bfb1-cc3a-4853-9f7b-47dc385ff421","resolution":{"observed_at":"2026-08-15T19:59:27.973803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-08-15T16:51:35.217742Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-15T19:59:27.980409Z","title":"Vibevoice technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.980409Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:4f1c3114300a4981f345e4bc95e6133cfc4127fb7fc57ebaab365d1ceec08f82","observation_id":"a5b01b59-4c4b-4f1a-a1f9-9e80d93ff61e","resolution":{"observed_at":"2026-08-15T19:59:27.980409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.602919Z","title":"Autoregressive image generation without vector quantization,","venue":null,"work_id":"fdf2d07d-b68f-4bd8-8eb9-d74f9147de66","year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.985469Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:cafae8b252e786fa42d69cfebd6bdc848671e8273cfc78c7586bf169d2332329","observation_id":"8bb279a8-fcfe-4d41-9a00-afdaa650f374","resolution":{"observed_at":"2026-08-15T19:59:29.608699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08635","last_updated":"2024-12-11T18:57:32Z","snapshot_observed_at":"2026-08-16T13:00:15.419884Z","submitted_at":"2024-12-11T18:57:32Z","title":"Multimodal Latent Language Modeling with Next-Token Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08635","snapshot_observed_at":"2026-08-15T19:59:27.991313Z","title":"Multimodal latent language modeling with next-token diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.991313Z"},"links":{"cited_paper":"/paper/2412.08635","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:10291c8d9b18a13ebee17022fad862b1f4202c4ebed85738cfa281f46537ebe7","observation_id":"b197548f-8178-47c0-8266-9e71eb52b8d8","resolution":{"observed_at":"2026-08-15T19:59:27.991313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.583736Z","title":"Diffusion forcing: Next-token prediction meets full- sequence diffusion,","venue":null,"work_id":"10ccf7d4-675d-4eb5-9473-4ec7ea865fe1","year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.996597Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:92c0ee5c6c2472141253fb6bcc687f8a4a6b845b5478d552f6b1abab9c606006","observation_id":"d3566ea0-abd0-408d-b501-4b91df69ad02","resolution":{"observed_at":"2026-08-15T19:59:29.588953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.566611Z","title":"Ar-diffusion: Asynchronous video generation with auto-regressive diffusion,","venue":null,"work_id":"efa8bbb0-89f1-49fd-b917-05b0eeb04994","year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.001526Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:ced93c2ef799c128a5174656d1244b05141a69645536e74f007ae4ad6883f6ca","observation_id":"75d5a000-c748-4015-bb05-8ee6f530eebb","resolution":{"observed_at":"2026-08-15T19:59:29.571951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.006335Z","title":"From slow bidirectional to fast autoregressive video diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.006335Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:3f5182c40f5f4ca5fb6fcf6d18d6e5d620488502a92bd4368d91c874346b4446","observation_id":"af3eded2-31b4-4c50-837e-dfed01a0f30d","resolution":{"observed_at":"2026-08-15T19:59:28.006335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-08-16T13:44:53.534590Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-15T19:59:28.010553Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.010553Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:d8ad0905408575f171d2f9271fbfbe1f27275141d91ed0086cacf85906edbf19","observation_id":"07a195b0-f4f5-4445-9bed-70a0686ac9d2","resolution":{"observed_at":"2026-08-15T19:59:28.010553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.014885Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.014885Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:52236fb87056e5b44222398fb9c114c22823864d2bf0be927da91e6fdf55a784","observation_id":"1f3e1cfa-ff5f-4b5f-8018-3e59180656f4","resolution":{"observed_at":"2026-08-15T19:59:28.014885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.019584Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.019584Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:e465a24fd82e3c4f877dde9164b5d40e356b503ea476b26580fe3d3d9a4a44da","observation_id":"f2d2b4e9-7be7-4377-84d0-03be0240496b","resolution":{"observed_at":"2026-08-15T19:59:28.019584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T19:59:28.023555Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.023555Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:e94bdbd2ba56241bcd6e9ba5b72da083275dcbcacc629ba0e4b2349c214729e8","observation_id":"7e62f14f-8aa5-47c7-b3a0-665605ff195b","resolution":{"observed_at":"2026-08-15T19:59:28.023555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.028855Z","title":"Diffusion model alignment using direct preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.028855Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:643c9d66c35288ecb93c0a32f2c4b95a9983921dd161cd6f44b11202f3ece4bb","observation_id":"9ba2ffbe-557a-48f1-9681-257523f30d75","resolution":{"observed_at":"2026-08-15T19:59:28.028855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-13T10:15:00.293616Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-08-15T19:59:28.033504Z","title":"Flow-grpo: Training flow matching models via online rl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.033504Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:58d8b18d3d6c36623981154b5e8a3ca84b7deaf6ee4fb2b78d1a7e8bb815df42","observation_id":"c80060bc-4f9c-4e80-aa63-5d53c0bc9620","resolution":{"observed_at":"2026-08-15T19:59:28.033504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.038349Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.038349Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:d7b6d10987c5e052b2b77ac98c5146bd3b66999f7a888cf19b5b8620affcecb9","observation_id":"66b75809-d0c6-4cef-9110-77544283a6d2","resolution":{"observed_at":"2026-08-15T19:59:28.038349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-08-15T19:59:28.042751Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.042751Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:573130cf526672b7a0edf68a730dda085a54175c01d755bfc8b7184af07f7363","observation_id":"4105aa1f-213f-48c2-8a20-1390f1db9ce3","resolution":{"observed_at":"2026-08-15T19:59:28.042751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.047622Z","title":"Prismaudio: Decomposed chain-of-thoughts and multi- dimensional rewards for video-to-audio generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.047622Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:974c6046084d8b2e5573b246edbc5473b1c1ddb2009e0fa7c7da49de300ca6eb","observation_id":"82799c0c-fb11-4167-810a-2fa0dba1358e","resolution":{"observed_at":"2026-08-15T19:59:28.047622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06225","last_updated":"2025-04-08T17:13:41Z","snapshot_observed_at":"2026-08-16T12:42:55.779138Z","submitted_at":"2025-04-08T17:13:41Z","title":"Encoder-Decoder Gemma: Improving the Quality-Efficiency Trade-Off via Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06225","snapshot_observed_at":"2026-08-15T19:59:28.052309Z","title":"Encoder-decoder gemma: Improving the quality-efficiency trade-off via adaptation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.052309Z"},"links":{"cited_paper":"/paper/2504.06225","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:cd8c772013ff11d5f757ce18c945ab5cc20d92297ff46e6cb04a52ad5b0ee9cc","observation_id":"51032a5c-5bd4-4272-bfe1-26817814fcce","resolution":{"observed_at":"2026-08-15T19:59:28.052309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.057140Z","title":"Scaling rectified flow transformers for high-resolution image synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.057140Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:ad8737bc8c807c82b40f580ccea3adc2f923618deb92ec025b2ff8f80485a63e","observation_id":"b5083e75-2e93-4974-ba49-3b99ad272108","resolution":{"observed_at":"2026-08-15T19:59:28.057140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.062233Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.062233Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:7bed4eee65775ef0ef3ad1f7f07b2cc57862a03a31fbc7578416faf7852f870f","observation_id":"75e931a7-5bd3-4985-b1dd-2a0d92bbb7e8","resolution":{"observed_at":"2026-08-15T19:59:28.062233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.067072Z","title":"Pushing the frontier of audiovisual perception with large- scale multimodal correspondence learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.067072Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:988c17b531a186a24e176c9fa057914826aaa29099750f4e4f5d0b74b4727a70","observation_id":"41fca24d-5715-4638-b59f-0c3a15bdffc9","resolution":{"observed_at":"2026-08-15T19:59:28.067072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.071833Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.071833Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:e2249beeffdfbdbfb0e97a5a4c40802a351b4cb61db65246935953d2c435548b","observation_id":"6cc44144-8abd-4bc0-8e6e-cac480c7ee4b","resolution":{"observed_at":"2026-08-15T19:59:28.071833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-14T10:00:02.244477Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-15T19:59:28.076577Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.076577Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:f49e4db0e3c184a65566e6f5984c63b596d8ac6d5b4b36682dc76b941ff5a0bf","observation_id":"c2679713-1b2e-4c87-a486-2d476399e67d","resolution":{"observed_at":"2026-08-15T19:59:28.076577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-08-11T19:32:15.215968Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-08-15T19:59:28.082042Z","title":"Perception encoder: The best visual embeddings are not at the output of the network,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.082042Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:613ea706b8e8989c926fd16c63da7e46226bb8c205624419318d550ab3ca3a35","observation_id":"a5cf7cb9-6724-4db5-9aae-ebf7f988b05a","resolution":{"observed_at":"2026-08-15T19:59:28.082042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.087451Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.087451Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:c5182be1749d5be78d3ea71a40516e5da6f9c209011d023ae2dd3a0d0799c553","observation_id":"57793283-bf3c-49a9-99ec-c25775040d89","resolution":{"observed_at":"2026-08-15T19:59:28.087451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.093470Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.093470Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:14deae9c7e30b35bed3945a5611371cdf7c8e7c8976364a7a503f23ce2dbe44e","observation_id":"fc60f91d-1943-4301-b70d-ba330f6667fc","resolution":{"observed_at":"2026-08-15T19:59:28.093470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-15T19:59:28.098401Z","title":"Qwen3-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.098401Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:c5d5fd393a7cb4c7f56c58b91a349ce9c8c68d66ce23a3c27923c7be90049742","observation_id":"7d63786f-1a21-4db8-8bdc-9979a0468d25","resolution":{"observed_at":"2026-08-15T19:59:28.098401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T19:59:28.103563Z","title":"Gem- ini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.103563Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:930956c92eaf35099c252eafca8d31a647afd45c47f48dc1e811076a5cc3feae","observation_id":"ed244f27-16a0-48bc-b0fd-649b05ff085b","resolution":{"observed_at":"2026-08-15T19:59:28.103563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-16T15:38:16.919337Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-15T19:59:28.108913Z","title":"Text-to-audio generation using instruction tuned llm and latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.108913Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:b4eec5cd0b32df1565d9fdd85c86182f67b35f4b21e1085845e2f2d0a5d10e7e","observation_id":"1ce6a461-38e5-4e33-923e-615220c5ba34","resolution":{"observed_at":"2026-08-15T19:59:28.108913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17991","last_updated":"2026-05-18T07:47:03Z","snapshot_observed_at":"2026-08-16T06:50:56.794163Z","submitted_at":"2026-05-18T07:47:03Z","title":"Stable Audio 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17991","snapshot_observed_at":"2026-08-15T19:59:28.113594Z","title":"Stable audio 3,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.113594Z"},"links":{"cited_paper":"/paper/2605.17991","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:b3483229b7cceb86c30511adf44097b1fffe9ad0c8a68431ac88d6fe3193b21d","observation_id":"4d226849-db7e-46e5-b47a-528492a59207","resolution":{"observed_at":"2026-08-15T19:59:28.113594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-15T19:59:28.118525Z","title":"Qwen3-tts technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.118525Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:e43be2960672c4b3ef0b6929dd7e2874686c42155395f31fa4eb2fa4cc927833","observation_id":"80503fad-106d-4373-b186-6af0fc741e39","resolution":{"observed_at":"2026-08-15T19:59:28.118525Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.123447Z","title":"Audio set: An ontology and human- labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.123447Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:9ac072361dd42c8ec73615d332dcf69c21914d498e405bad01cf423a389518fe","observation_id":"03b9926f-c8a4-435b-b776-bcb75964a85c","resolution":{"observed_at":"2026-08-15T19:59:28.123447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.405249Z","title":"Vggsound: A large- scale audio-visual dataset,","venue":null,"work_id":"1a791c85-bf11-4ed6-9eeb-c57768722963","year":2020},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.127970Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:1d2bfdcb345b3f90ef8d738a3b2fce8ed090d45a0c05cce3283262573f207145","observation_id":"71fd00e1-91d5-4e27-9f7b-fd3f40df3c7d","resolution":{"observed_at":"2026-08-15T19:59:29.411187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.378887Z","title":"Do not imagine or add details not mentioned in the source","venue":null,"work_id":"da958988-18b6-450e-b18c-1fb15982ad94","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.132670Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:1f3f97f4a0f71499a941e6bda8204450c450a38c9fd5153911e314c9eeb2c8e1","observation_id":"87724f78-a4f8-4606-8c90-d3110b0ca09c","resolution":{"observed_at":"2026-08-15T19:59:29.387845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.346169Z","title":null,"venue":null,"work_id":"b98a2c3e-b064-4de2-a870-32542c011ad8","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.136808Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:b2022165381820b2383f0c032b1cdb1cf47c939a64061b1fe0e9188dc25e81ca","observation_id":"816fc41c-7a99-4bfe-8ed7-08ddcfb311ce","resolution":{"observed_at":"2026-08-15T19:59:29.352341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.320881Z","title":"Preserve timing and dynamic changes","venue":null,"work_id":"a72084ff-df78-4f83-b5a7-fc37ab1859e0","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.140856Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:cb437d890c0713ca267fc2383a6399c38fe08152aac083f428e8b9b88f58723c","observation_id":"f888248b-5156-4dfd-b180-01c5be2dbef2","resolution":{"observed_at":"2026-08-15T19:59:29.328448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.293675Z","title":"[SPEECH CONTENT](Transcription)","venue":null,"work_id":"b81b5517-e407-44ca-8de3-f8d9ec6cb616","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.145387Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:18f40740b082c2c32cbb158e8179b3a9f7a13819f7ea6f30d2687b8c88f8f5dc","observation_id":"99fce691-8cae-4cdb-a274-449959ed1b9a","resolution":{"observed_at":"2026-08-15T19:59:29.300221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.275989Z","title":"caption short","venue":null,"work_id":"965bf8e7-74ca-4c90-8241-a6ec74cdea6b","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.149459Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:6bbb0691adbc2b67875f7e7d1d9683b05219f7684fccff5d0a5190fa6212db35","observation_id":"8b49d9ef-02ad-4c33-ac26-5f4555586862","resolution":{"observed_at":"2026-08-15T19:59:29.281249Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.258250Z","title":null,"venue":null,"work_id":"314db873-4f12-4578-a32c-891228d3b9b5","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.153835Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:672fdb01b0179bbf6f4c5a347ba36a7311ed8ec0a9727d54801f1bbc78c86e9c","observation_id":"5a1aaba8-c8d6-4254-8d74-3f72e442175a","resolution":{"observed_at":"2026-08-15T19:59:29.263787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.241244Z","title":null,"venue":null,"work_id":"73d779d7-ad24-4e02-8a05-7fea16281aae","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.158610Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:a03df25793ca00a38fde558e7d4c8d3ddf3b404545a73c85bd5cb16766a8bb96","observation_id":"72c075a1-0cac-41ff-ac84-5e4a81757ab0","resolution":{"observed_at":"2026-08-15T19:59:29.246213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.225812Z","title":null,"venue":null,"work_id":"44a855ac-854b-49a5-a53d-87ec5e61fad6","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.163731Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:52eb87be5961c7858780f798bd54660029ca7b56c1f6530fe5f0d403bef89e08","observation_id":"e3d46a85-a6e5-4a5f-9391-385e68dff3be","resolution":{"observed_at":"2026-08-15T19:59:29.230376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.209964Z","title":null,"venue":null,"work_id":"64a0993a-5327-4c12-8d74-33e4f3559c50","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.168888Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:d79cf7db916b5b5bc37ece4800faf3d3c1e622895681ef8d61084d3a6267df9c","observation_id":"ec19f2be-e176-4b89-b258-0136fb59b782","resolution":{"observed_at":"2026-08-15T19:59:29.214950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.192357Z","title":null,"venue":null,"work_id":"c7b1be83-cd85-495a-b3f3-15c24b0c892d","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.173507Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:21fa5cf89680b37e1d63b3a8e2f298c9a14294ab1f80d70fe984056cd0f2a208","observation_id":"35bd4d4f-b5c6-4b43-b5ab-7a89b4847526","resolution":{"observed_at":"2026-08-15T19:59:29.197938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:29.175273Z","title":"candidates","venue":null,"work_id":"79af2a06-ef24-4b83-b6a0-f057fb6c8964","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.179211Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:c881d9db5ec752eb579c14e4f50cc67ccee5422de6fc0140d374034c0350043b","observation_id":"064dc0c6-3cb4-4d83-8434-2fce47717b4b","resolution":{"observed_at":"2026-08-15T19:59:29.180424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1520.0790","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:28.308528Z","title":"TABLE VII PER-CATEGORY RESULTS ONMECAT-EN","venue":null,"work_id":"13e85d27-91fb-40ed-9be9-40398942e0d6","year":null},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:28.185416Z"},"links":{"citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:a1dd5138f9839938a50eee3738cfc992b96f75397fe929a987e5668592b95e31","observation_id":"e87d1c4f-25ce-4ce7-84d3-5ff3e35979f2","resolution":{"observed_at":"2026-08-15T19:59:28.323919Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T23:11:21.506181Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2608.12951."}