{"as_of":"2026-08-12T17:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d5f35ee19ea128c58c525facf413cd36aa93e744a292d1c18a4558a9e2c8080","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:21:34.742952Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:12:09.446928Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.484714Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2505.13777","last_updated":"2026-04-11T05:01:03Z","snapshot_observed_at":"2026-07-06T21:26:40.118249Z","submitted_at":"2025-05-19T23:36:04Z","title":"Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T13:38:17.640841Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2505.13777"},"observation_digest":"sha256:570faadb324e87ef7380e704b143e652d80df2afefd38b4c4ffc1171864287fe","observation_id":"b1f054af-4f43-4264-b9f8-10dfb0aa539c","resolution":{"observed_at":"2026-05-22T13:41:36.642247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-08-07T11:12:09.446928Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-08T01:59:18.334752Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.446928Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:107221465c51ed0856c07594cd78088445baa1097d6319c26fbcb9022a1a1f21","observation_id":"ae659b54-8ae6-4d0f-8e35-7eb036357a6c","resolution":{"observed_at":"2026-08-07T11:12:09.446928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-08-06T14:04:00.556655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19835","last_updated":"2025-07-26T07:12:02Z","snapshot_observed_at":"2026-08-10T01:20:19.295050Z","submitted_at":"2025-07-26T07:12:02Z","title":"SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:04:00.556655Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2507.19835"},"observation_digest":"sha256:dc278c7c2af2afda5978bdc812ac485a57275f48542e1df8d69e96183ecb4257","observation_id":"d8a1eb31-d758-489d-9bb4-91319a8dc326","resolution":{"observed_at":"2026-08-06T14:04:00.556655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-08-06T13:14:37.521235Z","title":"A.; Li, C.; Valle, R.; Catanzaro, B.; and Poria, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20880","last_updated":"2025-07-28T14:34:02Z","snapshot_observed_at":"2026-08-06T16:37:02.345788Z","submitted_at":"2025-07-28T14:34:02Z","title":"JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T13:14:37.521235Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2507.20880"},"observation_digest":"sha256:3c8d8f04a6498d2acaecd031ac3c9c29fec800ae4afaf601b0e47239f3236d8c","observation_id":"89187b51-2060-42e8-8272-45b469a396f2","resolution":{"observed_at":"2026-08-06T13:14:37.521235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2509.14003","last_updated":"2026-04-15T19:46:03Z","snapshot_observed_at":"2026-08-07T11:10:48.282835Z","submitted_at":"2025-09-17T14:13:40Z","title":"RFM-Editing: Rectified Flow Matching for Text-guided Audio Editing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T16:34:17.431134Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2509.14003"},"observation_digest":"sha256:90c68e27645b2468b06b2a1c28061b27ee57513e9482037cc48c3c0f4bf0f947","observation_id":"a9360261-9ba8-4900-a57c-82210bd60359","resolution":{"observed_at":"2026-05-18T16:36:37.020189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2509.23727","last_updated":"2026-04-09T14:19:05Z","snapshot_observed_at":"2026-08-11T11:22:18.507921Z","submitted_at":"2025-09-28T08:12:43Z","title":"AudioMoG: Guiding Audio Generation with Mixture-of-Guidance","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-18T13:10:18.700497Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2509.23727"},"observation_digest":"sha256:a0779423b295b7f85711cf5a97da4d3514ffd6695e86b8f2fcf7a466b505bb34","observation_id":"7f2626d6-579d-4430-8d7b-a17467c8e3bc","resolution":{"observed_at":"2026-05-18T13:11:23.820034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-08-03T07:06:33.216494Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21402","last_updated":"2026-07-02T10:34:29Z","snapshot_observed_at":"2026-08-06T16:31:01.007730Z","submitted_at":"2026-01-29T08:40:37Z","title":"SemanticAudio: Audio Generation and Editing in Semantic Space","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T07:06:33.216494Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2601.21402"},"observation_digest":"sha256:35ddbc3835272ee551a07ab7bcaf4fb66f86a0b2e9b842ce714fed7d0400c4e6","observation_id":"8393a281-f852-4a31-a326-1d41ad32bbb6","resolution":{"observed_at":"2026-08-03T07:06:33.216494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2604.01929","last_updated":"2026-04-29T10:54:09Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T11:49:00Z","title":"Woosh: A Sound Effects Foundation Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T20:51:08.144573Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2604.01929"},"observation_digest":"sha256:17730c08c277dc3d6115cb00cd9bfc303a8f8df2f7fc2fbcd021bbae2ce66e04","observation_id":"974ba821-f86c-43ec-aec3-c44a3ab2bc2a","resolution":{"observed_at":"2026-05-13T20:53:15.849552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2604.15086","last_updated":"2026-04-16T14:47:24Z","snapshot_observed_at":"2026-08-11T09:40:24.704947Z","submitted_at":"2026-04-16T14:47:24Z","title":"ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T09:22:10.483263Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2604.15086"},"observation_digest":"sha256:b747169ca15257828a851452d86324bea1986dfe52c5adb05ce621f2abf1b918","observation_id":"0064991e-42bb-4efb-b39c-3d94b6b6da73","resolution":{"observed_at":"2026-05-10T09:23:37.054519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-11T06:31:47.003544Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:6836ee90714fffd9044c52b0d20e28af26d7d830c4716e4b21a4a69d88791602","observation_id":"2a3f17f9-1852-4239-ae25-f01a34248660","resolution":{"observed_at":"2026-05-11T15:46:44.885236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2605.11866","last_updated":"2026-05-20T03:22:45Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:46:36Z","title":"AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:06:54.972846Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2605.11866"},"observation_digest":"sha256:358fb95381bf9be6be0f54ebcf9f628dab8056c33b491e791976a8797c21685e","observation_id":"d47cc885-7e9c-4793-8dc5-b325ba92850b","resolution":{"observed_at":"2026-05-13T05:07:17.274264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2605.11866","last_updated":"2026-05-20T03:22:45Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:46:36Z","title":"AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T08:28:21.790110Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2605.11866"},"observation_digest":"sha256:72397b2ea95b89a192c54f1d45f603401828a45635157a1d332174f086225c55","observation_id":"54e22aad-cf03-451f-a628-d13534dc5ff2","resolution":{"observed_at":"2026-05-21T08:29:52.743864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2605.27838","last_updated":"2026-05-27T01:50:29Z","snapshot_observed_at":"2026-08-07T16:32:25.292688Z","submitted_at":"2026-05-27T01:50:29Z","title":"Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T10:56:00.765400Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2605.27838"},"observation_digest":"sha256:29b2f53ca26835ea9f8e4c32f67ec2ed8d50ba44f5d1344bd55717bbd98dcfc8","observation_id":"669b3f78-a6b5-4039-bc2f-28ca9bcf3bef","resolution":{"observed_at":"2026-06-29T11:03:18.758307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2605.30965","last_updated":"2026-05-29T07:58:54Z","snapshot_observed_at":"2026-08-02T19:54:21.945716Z","submitted_at":"2026-05-29T07:58:54Z","title":"ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T21:12:19.893944Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2605.30965"},"observation_digest":"sha256:19812e5cb215d0e59daaf1b27c746730cd6c1ddb0c0a3620aeb030cf719621e5","observation_id":"d4ff063d-a656-4c2b-81a0-0d5a6086c142","resolution":{"observed_at":"2026-07-01T20:26:12.629539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2605.31530","last_updated":"2026-06-02T14:24:03Z","snapshot_observed_at":"2026-08-12T13:01:13.689618Z","submitted_at":"2026-05-29T16:43:07Z","title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-28T20:44:20.190064Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2605.31530"},"observation_digest":"sha256:0a1bb2c52664743bb4294d5092d431459407cdfa3ccdf208c6b0dc5d55e26ca0","observation_id":"eed75720-14f1-41b5-89e4-64dd56b13bc4","resolution":{"observed_at":"2026-06-28T20:52:37.895615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2606.12555","last_updated":"2026-07-02T19:10:03Z","snapshot_observed_at":"2026-07-12T14:16:32.755376Z","submitted_at":"2026-06-10T18:06:27Z","title":"AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T08:04:48.283908Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2606.12555"},"observation_digest":"sha256:8a25ead5774ed4db5701b9dc9e462c3e0041ed6efd486f360bdb38efc46fd62f","observation_id":"7b58e407-6dba-4f8f-8277-b69eda7cb2e4","resolution":{"observed_at":"2026-07-03T13:28:18.809247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2606.20101","last_updated":"2026-07-13T22:06:08Z","snapshot_observed_at":"2026-07-17T23:18:05.285816Z","submitted_at":"2026-06-18T11:20:08Z","title":"RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T15:51:48.672086Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2606.20101"},"observation_digest":"sha256:d78d9ff9beeef6eba743cd83d712a11422bf51324b23a17e67e0491b37014361","observation_id":"90e5fdab-695d-4dd1-806f-14f8978ac129","resolution":{"observed_at":"2026-07-04T05:39:39.325372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2606.20101","last_updated":"2026-07-13T22:06:08Z","snapshot_observed_at":"2026-07-17T23:18:05.285816Z","submitted_at":"2026-06-18T11:20:08Z","title":"RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T23:36:39.368933Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2606.20101"},"observation_digest":"sha256:f207000f3dd5284cce493a495f43504bd872d72d75f6d8ec208abb0403fd7e05","observation_id":"8592f3b5-52e4-43f6-ba32-29cdba770adc","resolution":{"observed_at":"2026-07-03T23:39:03.009210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-15T10:41:34.347336Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20101","last_updated":"2026-07-13T22:06:08Z","snapshot_observed_at":"2026-07-17T23:18:05.285816Z","submitted_at":"2026-06-18T11:20:08Z","title":"RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-15T10:41:34.347336Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2606.20101"},"observation_digest":"sha256:5651715777b5cdbf922020ebb5f37267486759928cacfddc173365d9f110069e","observation_id":"e61d5d58-1987-45ec-9f36-d1c8396bf123","resolution":{"observed_at":"2026-07-15T10:41:34.347336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2606.23064","last_updated":"2026-06-22T09:13:57Z","snapshot_observed_at":"2026-08-06T08:41:01.968593Z","submitted_at":"2026-06-22T09:13:57Z","title":"STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T07:26:28.527338Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2606.23064"},"observation_digest":"sha256:fc3f6438ce3524c0bec9fa3ccb619b46ea86bcd6be012100f3f1a8e1bd9fc893","observation_id":"4baf9019-5e80-41d4-915c-809308adecbf","resolution":{"observed_at":"2026-07-04T11:59:50.510846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:717bc0b1a4bbd028ab507a2436e610337424db9ca6c2fa3584a6b4ff7428bc22","observation_id":"8884b445-2c4e-4aff-a6df-11c1a21fede7","resolution":{"observed_at":"2026-07-04T11:59:50.936746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2606.31026","last_updated":"2026-06-30T01:46:54Z","snapshot_observed_at":"2026-08-12T12:47:06.701026Z","submitted_at":"2026-06-30T01:46:54Z","title":"OTCache: Optimal Transport for Geometry-Aware Caching in Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T06:21:22.905093Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2606.31026"},"observation_digest":"sha256:e2086c8e9bd07b5c07dcccf32654b4c8135b60e82e606a05850a390a7f9c5b5c","observation_id":"0be1038d-40fb-4b97-9e2e-ef62dc9d9c0e","resolution":{"observed_at":"2026-07-01T09:45:39.526005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-11T12:34:20.057072Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04848","last_updated":"2026-07-06T09:19:03Z","snapshot_observed_at":"2026-08-07T07:26:18.976803Z","submitted_at":"2026-07-06T09:19:03Z","title":"SynSFX: Multi-Model Sound Effects Synthesis Dataset for Deepfake Detection and Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T12:34:20.057072Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2607.04848"},"observation_digest":"sha256:ed3554a80963f0484bf43512f2f6a965a732d5a10d830c059000a865c4ee1365","observation_id":"8b3a5318-e541-410b-ab9d-f7fa63760899","resolution":{"observed_at":"2026-07-11T12:34:20.057072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":"2412.21037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-08T00:04:22.484714Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":"cs.SD","work_id":"00a970af-6ebd-49c3-86db-337517696f53","year":2024},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:20774459bce0841b0b53d4da76dcbd9afae9804f87ad18587c623402e912dd30","observation_id":"36c66311-2b38-4296-a892-9e8c1a3e23f9","resolution":{"observed_at":"2026-07-08T00:04:22.486119Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2412.21037 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:1c9231db9ae6b57a1865ccc2d07920f0e26108f3d413478b093779836d737525","observation_id":"8241ceab-0a78-49e3-bcd3-0e2e34d842ce","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:1c56f5b3160bfd329208c9b8f62d72d2c0bb51e88f6fe107ed4e0ce1da61d59b","observation_id":"5225392a-18c1-4d74-bb3a-67134f339fb3","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.21037/citation-record","integrity":"/paper/2412.21037/integrity","json":"/paper/2412.21037/citation-record.json","paper":"/paper/2412.21037"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.457797Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.457797Z"},"links":{"citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:02ff133a83b92078781a0491e77f693a1b03c071ed419329ccb2a4410daddbcb","observation_id":"dfbe94c7-e846-4d66-a21b-4e04b05ebcc5","resolution":{"observed_at":"2026-08-10T23:21:34.457797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15571","last_updated":"2023-03-09T15:18:40Z","snapshot_observed_at":"2026-08-12T12:53:05.797256Z","submitted_at":"2022-09-30T16:30:31Z","title":"Building Normalizing Flows with Stochastic Interpolants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15571","snapshot_observed_at":"2026-08-10T23:21:34.463848Z","title":"Albergo and Eric Vanden-Eijnden","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.463848Z"},"links":{"cited_paper":"/paper/2209.15571","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:fd4411e656a522b76702e1c1bc820764adeb8a9b2ad3907de4db758fd5164c8b","observation_id":"714224b0-ccce-4531-8ba9-b03a719a33a4","resolution":{"observed_at":"2026-08-10T23:21:34.463848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-10T05:25:44.328250Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-10T23:21:34.469104Z","title":"Self-play fine-tuning converts weak language models to strong language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.469104Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:d2ccf83961e29750f9a25c476120d1f47074d7f3fe9557c6adde2e4bf717c67d","observation_id":"df247e50-6c54-4caa-aa95-a138a2e0471f","resolution":{"observed_at":"2026-08-10T23:21:34.469104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-10T23:21:34.473968Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.473968Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:2dd79352b2804515a3477e048b050308c9e86122f1a22ae0cb8377eb27e74477","observation_id":"5d977bf6-f9ce-49e1-b0b9-353689b69edf","resolution":{"observed_at":"2026-08-10T23:21:34.473968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-10T23:21:34.478441Z","title":"Qwen2-audio technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.478441Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:ddad5054db10bb24159017b8fcfc958716cd9cb306dfd8dbcc2614f75cdf93b3","observation_id":"e84b5fc1-60f1-473f-9258-c9cc3ef23958","resolution":{"observed_at":"2026-08-10T23:21:34.478441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-10T23:21:34.484425Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.484425Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:7c7d88996d7e4252ef3d0d2f5a7d049ab602dbd71bc1a5ed7d1b80dc30386b07","observation_id":"1f9b7d22-8a77-45a1-aa56-62b4f50e61d2","resolution":{"observed_at":"2026-08-10T23:21:34.484425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05284","last_updated":"2024-01-30T04:49:16Z","snapshot_observed_at":"2026-08-07T07:25:59.961338Z","submitted_at":"2023-06-08T15:31:05Z","title":"Simple and Controllable Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05284","snapshot_observed_at":"2026-08-10T23:21:34.489417Z","title":"Simple and controllable music generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.489417Z"},"links":{"cited_paper":"/paper/2306.05284","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:742859dc37a4ff6a65cfd1d061519821dea1cf152180b07fd7ab07d7bf6e5b72","observation_id":"17d9e8d6-fb67-4da7-b3a6-bc6ace5d818f","resolution":{"observed_at":"2026-08-10T23:21:34.489417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.494946Z","title":"Look, listen, and learn more: Design choices for deep audio embeddings","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.494946Z"},"links":{"citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:22739e3b280b14872afa44d3f23b80d05feaf9cde95f43e2a6a34c370d060774","observation_id":"94c062f7-c4eb-4548-b789-3bb438cb5475","resolution":{"observed_at":"2026-08-10T23:21:34.494946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-10T23:21:34.499424Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.499424Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:3b64f91a9a077ad2a9fed8c2af772117dfb0d13089868d1af06f5dbe66192936","observation_id":"08d2f6ec-be76-42ff-b0b7-0079eadb4f91","resolution":{"observed_at":"2026-08-10T23:21:34.499424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04825","last_updated":"2024-05-13T14:05:00Z","snapshot_observed_at":"2026-08-12T02:31:19.137622Z","submitted_at":"2024-02-07T13:23:25Z","title":"Fast Timing-Conditioned Latent Audio Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04825","snapshot_observed_at":"2026-08-10T23:21:34.503571Z","title":"Hawley, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.503571Z"},"links":{"cited_paper":"/paper/2402.04825","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:413b182e5b3d06547024fcb05bb3d0ba86def8087b1fa5ac735c4e20305433ab","observation_id":"cf778c2c-57b9-452a-b9f4-639f4e1eb360","resolution":{"observed_at":"2026-08-10T23:21:34.503571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10301","last_updated":"2024-07-29T14:52:26Z","snapshot_observed_at":"2026-08-08T11:05:56.363956Z","submitted_at":"2024-04-16T06:09:33Z","title":"Long-form music generation with latent diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10301","snapshot_observed_at":"2026-08-10T23:21:34.508244Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.508244Z"},"links":{"cited_paper":"/paper/2404.10301","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:03c1851b2d272e99112754a72d8e86855f354eab495e264e84fef69df4be59c3","observation_id":"bd53f9b4-b7ed-4ea9-ac89-ca6ec49087b2","resolution":{"observed_at":"2026-08-10T23:21:34.508244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-06T16:30:00.821754Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-10T23:21:34.512529Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.512529Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:2488cba94df720e43d52108366187fd3504c30d73ff4c79aabe71fc632b8bbe2","observation_id":"841081a2-dbfe-4ff0-8364-87da6a98e644","resolution":{"observed_at":"2026-08-10T23:21:34.512529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10760","snapshot_observed_at":"2026-08-10T23:21:34.516577Z","title":"Scaling laws for reward model overoptimization, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.516577Z"},"links":{"cited_paper":"/paper/2210.10760","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:217acd65e3d8a261463eb354a99fd2350fb33cf3bb06bb301b19299602463002","observation_id":"7fb785a6-bb01-44e5-b7b6-86b9edf7af67","resolution":{"observed_at":"2026-08-10T23:21:34.516577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-10T11:18:06.491859Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-10T23:21:34.520734Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.520734Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:95498de90288f76135bfdad2de5d7af5f5c85bc9902835dce7de3b4c0a7d9988","observation_id":"fee7105a-96f9-46eb-bcba-338e0d6ac279","resolution":{"observed_at":"2026-08-10T23:21:34.520734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-10T23:21:34.525539Z","title":"Reinforced self-training (rest) for language modeling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.525539Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:73f27aa956023a4249eebc27a78ee3111846584766f94a9d09c2c4e351c65dfa","observation_id":"c3475995-b8cf-4317-a40d-374602111266","resolution":{"observed_at":"2026-08-10T23:21:34.525539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09556","last_updated":"2024-03-11T04:01:34Z","snapshot_observed_at":"2026-08-12T12:00:43.740402Z","submitted_at":"2023-03-16T17:59:56Z","title":"Efficient Diffusion Training via Min-SNR Weighting Strategy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09556","snapshot_observed_at":"2026-08-10T23:21:34.529354Z","title":"Efficient diffusion training via min-snr weighting strategy, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.529354Z"},"links":{"cited_paper":"/paper/2303.09556","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:d1984c269c1a316b38c7bcf407e6257f8a1626d46052014120c1c5e884bf3a66","observation_id":"269f0661-ebb8-42a7-a46b-bb353b8d3ac2","resolution":{"observed_at":"2026-08-10T23:21:34.529354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T23:21:34.533363Z","title":"Classifier-free diffusion guidance, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.533363Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:269c1fc5b73475e0be5eb1c5f0e1c40cfed2d3ff4397f0651eded70c814bc95f","observation_id":"ef2c5bb6-dc29-4bed-b36b-22463c2671dc","resolution":{"observed_at":"2026-08-10T23:21:34.533363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-10T23:21:34.537595Z","title":"Denoising diffusion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.537595Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:bad6d5ca08a86fdd5ba7d397796c2134c14ee1b367b1449bd6b1238d8db82dba","observation_id":"5a84fea2-0bc2-4a98-ad1c-554f2e3bc54b","resolution":{"observed_at":"2026-08-10T23:21:34.537595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-08T06:05:53.280034Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-10T23:21:34.542147Z","title":"Make-an-audio 2: Temporal-enhanced text-to-audio generation, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.542147Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:57bd9629e9eb65f56d4fc9e4b8c1969575dff2a59769266b7657a2c57657f099","observation_id":"1b5ff383-615e-4c2d-b58c-a1f4a87c0976","resolution":{"observed_at":"2026-08-10T23:21:34.542147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12661","last_updated":"2023-01-30T04:44:34Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T04:44:34Z","title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12661","snapshot_observed_at":"2026-08-10T23:21:34.546697Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.546697Z"},"links":{"cited_paper":"/paper/2301.12661","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:45c32531a358341f4a6db194b27dab8bad861fee3983cac57c6fe47d81297514","observation_id":"5f2e0827-c153-4474-98f3-ecf7546a84f9","resolution":{"observed_at":"2026-08-10T23:21:34.546697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-10T23:21:34.551154Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.551154Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:61b1f47badc483bd9c82e825473410b504dd3dae042e540994826baf86f1f637","observation_id":"d70bc48e-facc-4e64-b3f0-07b86554d65b","resolution":{"observed_at":"2026-08-10T23:21:34.551154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00364","last_updated":"2022-10-11T13:20:30Z","snapshot_observed_at":"2026-07-06T13:16:16.926712Z","submitted_at":"2022-06-01T10:03:24Z","title":"Elucidating the Design Space of Diffusion-Based Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00364","snapshot_observed_at":"2026-08-10T23:21:34.555413Z","title":"Elucidating the design space of diffusion-based generative models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.555413Z"},"links":{"cited_paper":"/paper/2206.00364","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:72f39168366d9d649e3e7dea587915963b640a8948728d5c4cc54109ecca823e","observation_id":"3406b416-db76-49db-bef0-613d1fef4426","resolution":{"observed_at":"2026-08-10T23:21:34.555413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.559672Z","title":"A udio C aps: Generating captions for audios in the wild","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.559672Z"},"links":{"citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:6aa099a5b6858de7c697963b86adae41a9e04073a2bfc3fe89b92098546ac3fa","observation_id":"b74a1729-c083-437a-9882-6e724ec345fc","resolution":{"observed_at":"2026-08-10T23:21:34.559672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19270","last_updated":"2024-10-07T04:21:15Z","snapshot_observed_at":"2026-08-12T15:49:44.353462Z","submitted_at":"2024-03-28T09:56:04Z","title":"sDPO: Don't Use Your Data All at Once","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19270","snapshot_observed_at":"2026-08-10T23:21:34.563825Z","title":"sdpo: Don't use your data all at once, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.563825Z"},"links":{"cited_paper":"/paper/2403.19270","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:72a80ff108a690dbe11d6e5782e98ae8635586bb9057fcc2ff989db5c198c299","observation_id":"7f4c4502-1538-4d70-9098-679f50dcd79b","resolution":{"observed_at":"2026-08-10T23:21:34.563825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.568233Z","title":"Adaptive non-uniform timestep sampling for diffusion model training, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.568233Z"},"links":{"citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:6ebc1485a27088518b2ecb2296d2e2786545c93808dfdee47c09dc8a92a1a393","observation_id":"64cb2faa-aacb-4b6f-950b-8942914e7bf4","resolution":{"observed_at":"2026-08-10T23:21:34.568233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T23:21:34.574308Z","title":"Auto-encoding variational bayes, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.574308Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:56270b882efe987726324f83123919fb9c3ca2b1390dae27acd42cb1c21d1f27","observation_id":"7fff4a72-c2a1-43a8-a19b-7126519d6feb","resolution":{"observed_at":"2026-08-10T23:21:34.574308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15487","last_updated":"2024-07-08T20:15:33Z","snapshot_observed_at":"2026-07-06T18:35:08.874127Z","submitted_at":"2024-06-18T00:02:15Z","title":"Improving Text-To-Audio Models with Synthetic Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15487","snapshot_observed_at":"2026-08-10T23:21:34.578346Z","title":"Improving text-to-audio models with synthetic captions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.578346Z"},"links":{"cited_paper":"/paper/2406.15487","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:5cd19cdd4f4b09e0209f0f65542d197283beaffeeeb213df7dac1173f63dae39","observation_id":"f156cb9d-4ed3-4cd2-85d6-228143149360","resolution":{"observed_at":"2026-08-10T23:21:34.578346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-10T23:21:34.582426Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.582426Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:d093f52f4c44a03d4adc59548be4606912ebe6c85c13abf4309aa79b792677ba","observation_id":"701f1071-6946-4ab3-98b6-02b5ecff497b","resolution":{"observed_at":"2026-08-10T23:21:34.582426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-10T23:21:34.586528Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.586528Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:1e579c4a1f9bbaf80c49dc31fc3237dc4fb4d7e209cc044ed5a42826403c131f","observation_id":"f15dbce5-7bd9-4a40-bc3d-77dd6e8c322d","resolution":{"observed_at":"2026-08-10T23:21:34.586528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-10T13:43:11.982910Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-10T23:21:34.590797Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.590797Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:90426cedf2a77bc9472837f34bb17b066ce0fe55b0c363ce9c07506951aec4b9","observation_id":"b360166c-1f97-4adf-93ca-1ce8e1519132","resolution":{"observed_at":"2026-08-10T23:21:34.590797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00744","last_updated":"2024-02-01T16:39:47Z","snapshot_observed_at":"2026-08-09T04:57:47.965968Z","submitted_at":"2024-02-01T16:39:47Z","title":"BATON: Aligning Text-to-Audio Model with Human Preference Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00744","snapshot_observed_at":"2026-08-10T23:21:34.596114Z","title":"Baton: Aligning text-to-audio model with human preference feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.596114Z"},"links":{"cited_paper":"/paper/2402.00744","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:b08d74ce9ab4636094226affa92db59dbbdef5e95217543c7a0789c7a047d04b","observation_id":"2ef549bb-797d-4afa-b2bf-e04e44bff316","resolution":{"observed_at":"2026-08-10T23:21:34.596114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-10T23:21:34.601091Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.601091Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:72f96aae83a7fe2b9709e3f818489904357bb24f3fa06746f918530fe8586a73","observation_id":"42ce1007-43b2-4804-8fd2-be2f7163b7fb","resolution":{"observed_at":"2026-08-10T23:21:34.601091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16338","last_updated":"2024-03-25T18:18:40Z","snapshot_observed_at":"2026-08-12T06:38:16.057230Z","submitted_at":"2023-10-25T03:40:50Z","title":"Generative Pre-training for Speech with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16338","snapshot_observed_at":"2026-08-10T23:21:34.605049Z","title":"Liu, Matt Le, Apoorv Vyas, Bowen Shi, Andros Tjandra, and Wei-Ning Hsu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.605049Z"},"links":{"cited_paper":"/paper/2310.16338","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:1156364731dd01dee83ec875f09ec83cc1350b63011cfecfe158fa48439e7d09","observation_id":"84334678-d58e-4b68-a0fa-7ada18b2f96e","resolution":{"observed_at":"2026-08-10T23:21:34.605049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-10T23:21:34.609758Z","title":"Plumbley","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.609758Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:11f790fcf32f3e6d19e1524faf06738abac7b5ff6bdf093a878f02640b1e8a07","observation_id":"767aad89-3212-4799-8cce-c1d3d53b323c","resolution":{"observed_at":"2026-08-10T23:21:34.609758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05734","last_updated":"2024-05-11T11:24:51Z","snapshot_observed_at":"2026-08-10T02:51:47.132283Z","submitted_at":"2023-08-10T17:55:13Z","title":"AudioLDM 2: Learning Holistic Audio Generation with Self-supervised Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05734","snapshot_observed_at":"2026-08-10T23:21:34.613652Z","title":"Plumbley","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.613652Z"},"links":{"cited_paper":"/paper/2308.05734","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:6e625f74384f476f063035461047d63ae208a11155e919dbda97af83a4b36297","observation_id":"4d751b30-f5da-43c1-a422-3fc34a613848","resolution":{"observed_at":"2026-08-10T23:21:34.613652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12266","last_updated":"2025-06-03T03:00:01Z","snapshot_observed_at":"2026-08-12T08:11:22.772822Z","submitted_at":"2024-10-16T06:06:30Z","title":"FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation","version":2},"cited_work":{"arxiv_id":"2410.12266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12266","snapshot_observed_at":"2026-08-10T23:21:35.055818Z","title":"FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation","venue":"eess.AS","work_id":"64f83de1-ca22-4d88-95e0-68ec27d7eb51","year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.618608Z"},"links":{"cited_paper":"/paper/2410.12266","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:0daa7ee133daa640245a61e0ed2e9ffde457397a5134a9db2098961a58f349cd","observation_id":"c71edb85-6817-4f72-9c8a-436701d8accc","resolution":{"observed_at":"2026-08-10T23:21:35.061744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-10T23:21:34.623344Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.623344Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:127c0e3f066a37bb03249e9260d4ed5cf37b3d6105615f78cb91704d46f6b8eb","observation_id":"fe0d98a4-e94f-4339-8982-dbed3a07f311","resolution":{"observed_at":"2026-08-10T23:21:34.623344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T23:21:34.627496Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.627496Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:65ecc764a449ab211c962eb44d335c2014717f673c01f9332b21f90b5cb47ba5","observation_id":"1f20d4be-a857-4da3-96b6-70a59344e744","resolution":{"observed_at":"2026-08-10T23:21:34.627496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09956","last_updated":"2024-07-17T16:17:50Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:31:22Z","title":"Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09956","snapshot_observed_at":"2026-08-10T23:21:34.631417Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.631417Z"},"links":{"cited_paper":"/paper/2404.09956","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:a08c1d6e3e106a2fc39565577cbfca05ded426e461d6feb9c214f67b5dc9d16b","observation_id":"ef0aff9c-f639-460f-a2aa-732ccc90f8ec","resolution":{"observed_at":"2026-08-10T23:21:34.631417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:35.582966Z","title":"Plumbley, Yuexian Zou, and Wenwu Wang","venue":null,"work_id":"12e3088b-b77a-4b67-a180-f1d9e4db06fb","year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.635465Z"},"links":{"citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:32ecf5f2768a4c4bbae52de6cee12d01ffa44124924a0a884d69ea9d4617d2e6","observation_id":"cfa23ff7-b5ec-4705-9689-06d6f6473482","resolution":{"observed_at":"2026-08-10T23:21:35.586953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.00104","last_updated":"2021-03-23T20:30:00Z","snapshot_observed_at":"2026-07-06T09:24:33.323611Z","submitted_at":"2020-05-29T22:31:10Z","title":"OT-Flow: Fast and Accurate Continuous Normalizing Flows via Optimal Transport","version":5},"cited_work":{"arxiv_id":"2006.00104","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.00104","snapshot_observed_at":"2026-08-10T23:21:34.991760Z","title":"OT-Flow: Fast and Accurate Continuous Normalizing Flows via Optimal Transport","venue":"cs.LG","work_id":"de11c1e7-76c2-477b-af91-1cde10ddf479","year":2020},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.639882Z"},"links":{"cited_paper":"/paper/2006.00104","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:d01aab829163e31aaaf3955d09e04b72952ac7f95b844309f077a1ec009a03bd","observation_id":"4490b601-2476-42cd-88e9-4543666b1aeb","resolution":{"observed_at":"2026-08-10T23:21:34.999252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-10T23:21:34.644929Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.644929Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:8c3107177820bf08dc9e5b34f4497528ad0796717605fdae2cb3db440db28bf6","observation_id":"551e976d-da4d-4e16-bb2a-a38aec00af94","resolution":{"observed_at":"2026-08-10T23:21:34.644929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-10T23:21:34.648810Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.648810Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:23d101242d8de996f544cb4e49e40884197213044ba0ee173e0d416bc787af3a","observation_id":"bcd7b2ad-fd7d-478e-9c4c-b14d9e67b33a","resolution":{"observed_at":"2026-08-10T23:21:34.648810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-06T12:20:08.657659Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-10T23:21:34.652625Z","title":"Iterative reasoning preference optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.652625Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:75e8addfa3111dd8a6915c2657d644d168455b523250e59929861459ca99000a","observation_id":"04befc61-98dc-4740-9bff-2cc8530727dc","resolution":{"observed_at":"2026-08-10T23:21:34.652625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-10T23:21:34.657081Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.657081Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:ad8c46e572178de7e3515bf94dd0353fbf48a0fe6f52791965c82dd78df0af9f","observation_id":"62450e1f-c527-4a7d-b71c-2069d03824ee","resolution":{"observed_at":"2026-08-10T23:21:34.657081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-12T14:57:25.486017Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-10T23:21:34.662433Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.662433Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:c005ab20f9271ec8a2e2e31bdb64f9f238fe8aa736253385aea81e68991e8b16","observation_id":"b9ef3da2-eead-474a-8b86-200a858c4dc4","resolution":{"observed_at":"2026-08-10T23:21:34.662433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-08-11T21:48:23.224442Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-10T23:21:34.666487Z","title":"From r to q^* : Your language model is secretly a q-function, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.666487Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:26854ce34dea8e041ba5df11653254c58ea0287f8a26e6405ff8d2c93e5df580","observation_id":"59acef81-8414-467b-9b42-da40ddef3b22","resolution":{"observed_at":"2026-08-10T23:21:34.666487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-10T23:21:34.670941Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.670941Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:a7f0173649921cf9003aa57d0f77d6925208eaef91270bb4bc29be9964615ba2","observation_id":"f9127c2c-1a6b-4df6-b7a3-3b9c7e20e8fb","resolution":{"observed_at":"2026-08-10T23:21:34.670941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-10T23:21:34.675200Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.675200Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:285ed3881fb3344a3c3d5b4f493a5926c6bf6c3e8d2e8a4af3ce433a30c015fd","observation_id":"8b0373eb-58c6-4b89-9b4e-3d54e3ea2033","resolution":{"observed_at":"2026-08-10T23:21:34.675200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10752","last_updated":"2022-04-13T11:38:44Z","snapshot_observed_at":"2026-07-06T12:20:47.369918Z","submitted_at":"2021-12-20T18:55:25Z","title":"High-Resolution Image Synthesis with Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10752","snapshot_observed_at":"2026-08-10T23:21:34.679776Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.679776Z"},"links":{"cited_paper":"/paper/2112.10752","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:2434af4e8277389ff78adda11484de9f318e716662aaca522ba6428a439d6fd1","observation_id":"7ab6fe7a-80c9-4823-9087-910b88eb3cbe","resolution":{"observed_at":"2026-08-10T23:21:34.679776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03498","last_updated":"2016-06-10T22:53:35Z","snapshot_observed_at":"2026-07-06T04:59:35.089671Z","submitted_at":"2016-06-10T22:53:35Z","title":"Improved Techniques for Training GANs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.03498","snapshot_observed_at":"2026-08-10T23:21:34.684082Z","title":"Improved techniques for training gans, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.684082Z"},"links":{"cited_paper":"/paper/1606.03498","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:c64d2f116e5253ba11a53d9301a6183ca01a6d962b21ba43d6425c5fe2a5e5ec","observation_id":"bd0f18e1-e25d-4a21-9452-e4890320d749","resolution":{"observed_at":"2026-08-10T23:21:34.684082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-10T23:21:34.688478Z","title":"Denoising diffusion implicit models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.688478Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:31351ad2df6a0f32bc2ff5a3f7465fceaa5d75bdabdff1b1333c9a9c7f4683a4","observation_id":"00f413f2-7dbe-4219-9356-d4a9674bf326","resolution":{"observed_at":"2026-08-10T23:21:34.688478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05600","last_updated":"2020-10-10T07:46:19Z","snapshot_observed_at":"2026-08-01T16:44:46.833530Z","submitted_at":"2019-07-12T07:37:26Z","title":"Generative Modeling by Estimating Gradients of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05600","snapshot_observed_at":"2026-08-10T23:21:34.692979Z","title":"Generative modeling by estimating gradients of the data distribution, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.692979Z"},"links":{"cited_paper":"/paper/1907.05600","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:47706a1b90af852d43560dd7dd5ded8137c3758ddfd5b9e75aa0bc1d2e0fa4fd","observation_id":"45071ce0-1e92-4705-8903-b192bfc6f152","resolution":{"observed_at":"2026-08-10T23:21:34.692979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-10T23:21:34.697783Z","title":"Salmonn: Towards generic hearing abilities for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.697783Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:3838c4fce6db91344f604ecbaceef17a10459d7b5858b8eadf96968fd051a568","observation_id":"0043f3bd-eebd-4220-885b-bac5c6b7bd1f","resolution":{"observed_at":"2026-08-10T23:21:34.697783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-10T23:21:34.702355Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.702355Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:22e0460d38077a62a12eba8607637a3d8721c44fc40ee2a735300ce9b592fc7c","observation_id":"56e9bb92-efc9-44a4-bbb8-2d5ff679c976","resolution":{"observed_at":"2026-08-10T23:21:34.702355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-10T23:21:34.706605Z","title":"Audiobox: Unified audio generation with natural language prompts, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.706605Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:091e147d01005e46988088d952e83a2f7a6073c6bd5f796d5fa3de46c1aeeac3","observation_id":"9ae97aa0-ae99-4f7c-87d9-bcd2b1685718","resolution":{"observed_at":"2026-08-10T23:21:34.706605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12908","last_updated":"2023-11-21T15:24:05Z","snapshot_observed_at":"2026-07-06T16:50:46.608196Z","submitted_at":"2023-11-21T15:24:05Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12908","snapshot_observed_at":"2026-08-10T23:21:34.710431Z","title":"Diffusion model alignment using direct preference optimization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.710431Z"},"links":{"cited_paper":"/paper/2311.12908","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:91250e4bb60057a3ef75212187fc3c7630dd16322a0e4b445d74aed5109e2550","observation_id":"fb1276ca-32c7-4723-80ce-0182569c3495","resolution":{"observed_at":"2026-08-10T23:21:34.710431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.714901Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.714901Z"},"links":{"citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:332a319e3819654e68de2cb407fc349c1c192edb1af53fa3e848dd6b97bf82a7","observation_id":"0965e152-74d5-4b7c-bd7d-67728bb17a1e","resolution":{"observed_at":"2026-08-10T23:21:34.714901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01044","last_updated":"2024-01-02T05:42:14Z","snapshot_observed_at":"2026-08-09T15:48:23.364963Z","submitted_at":"2024-01-02T05:42:14Z","title":"Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01044","snapshot_observed_at":"2026-08-10T23:21:34.719059Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.719059Z"},"links":{"cited_paper":"/paper/2401.01044","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:4da95685caea739b65ded5bb71b469f9da1945767545460598e6a6054f028940","observation_id":"f5155aad-2141-441c-b2f4-1c807fdde1c4","resolution":{"observed_at":"2026-08-10T23:21:34.719059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-10T23:21:34.723994Z","title":"Self-rewarding language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.723994Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:b2018b3e3b15cb636c42c197bad3c641495e874eb92ce4e1647ec568ee185a30","observation_id":"0b1e123c-b37e-48b3-ba86-882ec43b24b5","resolution":{"observed_at":"2026-08-10T23:21:34.723994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14465","last_updated":"2022-05-20T13:52:54Z","snapshot_observed_at":"2026-08-05T03:08:42.211484Z","submitted_at":"2022-03-28T03:12:15Z","title":"STaR: Bootstrapping Reasoning With Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14465","snapshot_observed_at":"2026-08-10T23:21:34.728757Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.728757Z"},"links":{"cited_paper":"/paper/2203.14465","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:b7612cf5a3e090c2ea7a7fb00cbc0a763255e153a17420a316dd635278854705","observation_id":"098672e5-dc02-45e7-be75-259d3cc2dafa","resolution":{"observed_at":"2026-08-10T23:21:34.728757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.733438Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.733438Z"},"links":{"citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:77970ec9508d32aa5d69efa3b65c99a7970385f2b64b6550972f5f2e8c3aee58","observation_id":"9d46ae32-bd57-4a67-a35a-74489ec233b6","resolution":{"observed_at":"2026-08-10T23:21:34.733438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.737887Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.737887Z"},"links":{"citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:62d78ea57d9b1bbe4e8a0b2431fcd80b16cd2220636580e61c7c1b609097d3f3","observation_id":"de32df46-d16a-4d27-9505-3d1ed74b925e","resolution":{"observed_at":"2026-08-10T23:21:34.737887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:21:34.742952Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.742952Z"},"links":{"citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:ea1d03b922740202a0a596949c9d6883cba24567ca23535e6b1f9c1d8ab4ddd2","observation_id":"679cdb67-48ae-4f5e-ad85-54c4a6ccfd9f","resolution":{"observed_at":"2026-08-10T23:21:34.742952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T23:01:20.648881Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 26 inbound Pith citation observations for arXiv:2412.21037."}