{"as_of":"2026-08-13T21:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4d34a860b739751c4ef9e6b565e4bb458d012ef24e5fef7882f56cfff2781c1","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T03:45:40.636290Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.31259/citation-record","integrity":"/paper/2606.31259/integrity","json":"/paper/2606.31259/citation-record.json","paper":"/paper/2606.31259"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.253089Z","title":"Make-an-audio: Text-to-audio generation with prompt- enhanced diffusion models,","venue":null,"work_id":"391f0012-8ebf-40c7-8a86-9f9926c328de","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:733c456633590f8baefda6ab4f6ecf3dfd38e3eb2998f9ac81a9c7c9f3048d13","observation_id":"5ea8592d-e260-4e9d-846d-c89534dc9c97","resolution":{"observed_at":"2026-07-07T01:23:07.254303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.255054Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":"19deeaad-0485-44b6-a7e1-d98baa94d476","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:8377113878b09f142b5739297340016961fdfa5af6cc1f44cfa1ba6049c378ca","observation_id":"e832f22f-5a78-44ff-b0b8-063574399ea2","resolution":{"observed_at":"2026-07-07T01:23:07.256235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.248099Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"28b8446e-1154-4fb9-bfbb-a109fe0023c6","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:4e2bbd7ab402555d8ab3f712bc717dd653c9a9f08d7766b11bcb0eba367ad8a2","observation_id":"4a620aa2-6883-4dea-aee5-5764793845de","resolution":{"observed_at":"2026-07-07T01:23:07.249336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.243741Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretraining","venue":null,"work_id":"ebf73eaf-8c83-44e5-b1eb-a956b7fd9ded","year":2024},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:08cb54a58978080a9380f1351ab34f4476bf094b50f58f77d12e76a0e7034439","observation_id":"5b884f80-2ba9-48b0-abf5-378989279e80","resolution":{"observed_at":"2026-07-07T01:23:07.245047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.262634Z","title":"Any-to-any generation via composable diffusion,","venue":null,"work_id":"348bbce1-0032-4624-b052-ae3845615cab","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:ff00c528a56f6e997e1737b04740ea2cef72ac221a7cf331428e4e1451614463","observation_id":"414dd74d-f4dd-452a-8876-22be12576b5d","resolution":{"observed_at":"2026-07-07T01:23:07.263868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.256955Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,","venue":null,"work_id":"05d5b3c0-9035-4600-8246-453f2e2e81c1","year":2024},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:9866df17f5518ef7d8a3656b4a0746636dbdc3b79f780b88b9e268b2bc29a3e8","observation_id":"49ad1c5a-e797-4ad2-92b8-5d4e199f14f4","resolution":{"observed_at":"2026-07-07T01:23:07.258221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.331009Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization,","venue":null,"work_id":"eb763d52-7c3c-4e7f-8af8-9dcd8dc47df6","year":2024},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:097b2da6beb05065f3e73f4050ac3eba6fc0ee43a3cd181fa1e22adf32b2ce1c","observation_id":"44652a9a-ebf0-4e02-a6cd-f58d8276cf61","resolution":{"observed_at":"2026-07-07T01:23:07.332480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.815032Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"556bc6b5-6607-4a7d-871d-59b4cb93e3c9","year":2020},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:f20b251d41cb186746692edf547e284808a823a5703fd19fe71b7c24dabff2aa","observation_id":"28a7277b-f8bf-4cfc-8ef4-3f017db3587e","resolution":{"observed_at":"2026-07-07T01:23:07.279657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:05:49.873428Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"16faa83f-8ff2-4daa-96ee-9b50938af311","year":2021},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:35f27f032e38a4e3e8ae50897c37aeabf73223cb712c4e0bb8cef6a09975f2a8","observation_id":"4d8ee700-e503-4295-9a56-83ddbf834e01","resolution":{"observed_at":"2026-07-07T01:23:07.283418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.329143Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps,","venue":null,"work_id":"1768ba51-c144-4363-97be-8f10669727b6","year":2022},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:6a6f6bbf83311a8a5bb4ca1c31302b41abb3c4b3c83429ecd92aa85b51e114a5","observation_id":"ea950e4a-e0df-44d3-b54e-605c408b205c","resolution":{"observed_at":"2026-07-07T01:23:07.330382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.333066Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models,","venue":null,"work_id":"e1d7e616-f814-49e3-8a8f-c6ac07fcf419","year":2025},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:79726737d60a08d4236d33ef9dc82d8d04ef958bae23d74cefa41480bbdbbb9a","observation_id":"e81d83d3-b117-46d2-8dc2-ed5211fa980c","resolution":{"observed_at":"2026-07-07T01:23:07.334663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.337426Z","title":"Elucidating the design space of diffusion-based generative models,","venue":null,"work_id":"e4816fae-0696-421b-a109-650a387c70d9","year":2022},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:f366db5507e579481658b79d91abbf4c2c92c08ff763316b99967a5df84eebb4","observation_id":"1c8c73f1-8741-4dfb-8095-ac27e46cd834","resolution":{"observed_at":"2026-07-07T01:23:07.338922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.322510Z","title":"Analytic-dpm: an analytic estimate of the optimal reverse variance in diffusion probabilistic models,","venue":null,"work_id":"a4efd1a6-97a5-4021-9ecb-60fe0ef8ff5e","year":2021},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:27f5b361bf9b34cef0ed3f18c18a0ebd4e120b3529c4cff1e24ee6736113405b","observation_id":"b85ed6f7-fc2e-45d7-b3a3-a855b02a826e","resolution":{"observed_at":"2026-07-07T01:23:07.323764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.352186Z","title":"Consistency models,","venue":null,"work_id":"3d253b7c-979e-4963-be76-2e9de988a62f","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:2b3a54d294c36a780ca1799e3087ed232f27ce54ac5bcab794b8be5e07b1c753","observation_id":"8a6807da-9f65-4cc3-b049-c459aae6b750","resolution":{"observed_at":"2026-07-07T01:23:07.353838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.324501Z","title":"Consistencytta: Accelerating diffusion-based text-to-audio generation with consistency distillation,","venue":null,"work_id":"47a04eb4-c780-45b0-9db0-89a89cd7258c","year":2024},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:af0164f051f38dbd60cf7616bdd340091ed2a30528e880555676e5749102f1de","observation_id":"100b490a-db43-47b8-a455-8d17d3293fc5","resolution":{"observed_at":"2026-07-07T01:23:07.325851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.346833Z","title":"Audiolcm: Efficient and high-quality text-to-audio generation with minimal inference steps,","venue":null,"work_id":"0694a604-9c86-42f6-aabf-36a2eef121b9","year":2024},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:ac8e87bef87a07871186c3070234720ad47f4cc474f3d159b1fa788892bfd7c9","observation_id":"7e86ca38-588f-42c1-b013-dbf301d508dd","resolution":{"observed_at":"2026-07-07T01:23:07.348917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:24:51.295654Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"7b247239-4a60-47c3-ade6-006a375c3d43","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:1a7bf7e63c0a14998debfcafd0d94f341242f1bcffc33769fd11d0efc57fda7e","observation_id":"29755e60-187a-4df3-8d9b-4a82e9429a5b","resolution":{"observed_at":"2026-07-07T01:23:07.310263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.320673Z","title":"Ts2f: Text-assisted speech-to-face generation,","venue":null,"work_id":"ae30396d-030f-4bbf-8c59-578dfa050577","year":2025},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:f9a8271dfb432e5ce9cc780b8317faee5e9db5bdb9133a190e8a7795a971339e","observation_id":"0ce01166-648a-45b2-9f0d-a3d5aa2231c5","resolution":{"observed_at":"2026-07-07T01:23:07.321940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.318471Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"42d80927-e2a3-48f4-a4ec-fbc267be6fc0","year":2019},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:e30b8ae9b7f2c274ddc73627fe69ef1ce1df8527bab7a83d5c95156f0e3cbd6d","observation_id":"147d604e-9d83-49ac-b59a-af2cdb335604","resolution":{"observed_at":"2026-07-07T01:23:07.319977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.313331Z","title":"WavCaps: A ChatGPT-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"1d09d5b4-b99a-4248-a79f-3c0b9b34085e","year":2024},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:9396d7ea188c6889064303e5181f3d144caacdd14b1e1a18ef482d114e0133df","observation_id":"4c4083aa-ab37-4cd7-9df1-2c2dc7bbe03d","resolution":{"observed_at":"2026-07-07T01:23:07.315584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.316263Z","title":"Audiosetcaps: Enriched audio captioning dataset generation using large audio language models,","venue":null,"work_id":"03474c62-c486-4f3e-86b7-9cc68255930a","year":2024},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:682fe04f7de6cd1d3358c5c0a18f1ae4e6c9c0c2ba6e18e2e97706eab1cfd543","observation_id":"d91e1fe3-7281-4a62-bf7f-fdb63386e5b0","resolution":{"observed_at":"2026-07-07T01:23:07.317779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.326923Z","title":"Journeydb: A benchmark for generative image understanding,","venue":null,"work_id":"d07be653-9920-4ad0-8b57-e35cddfc2dfb","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:edcaa57c924fe20f01d980c28956048414e53bb7fb46fbc053506479914443d7","observation_id":"adc3b1f5-3410-4d24-9607-0b7b30dd42f7","resolution":{"observed_at":"2026-07-07T01:23:07.328463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.335290Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"458d8e5b-cc97-44eb-9fd1-88a382113f4f","year":2022},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:390fccf3e0c3d6b5f1a83090461f445230177cacae27caafaaaa43cdbe70208c","observation_id":"94db4798-f07f-480b-98ea-bb6f2d572426","resolution":{"observed_at":"2026-07-07T01:23:07.336702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.339568Z","title":"Prolific- dreamer: High-fidelity and diverse text-to-3d generation with variational score distillation,","venue":null,"work_id":"7d9f2c7b-4af8-4d7c-b6bf-d112bb2d6367","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:c0e2b4bd82a396c75c79f9872b2628ea7820cb9ec9a5d94b880f4ff3a43a2069","observation_id":"026bd4cc-cd01-408d-a812-8b1271a30ada","resolution":{"observed_at":"2026-07-07T01:23:07.341108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.303609Z","title":"Swiftbrush: One-step text-to-image diffu- sion model with variational score distillation,","venue":null,"work_id":"7747dd8a-f308-4e86-b354-a19ecb715571","year":2024},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:8fdd60b6149307b8dcc55bdf5e55bed19ade59e496a5bc99f9c3dcb8c06202eb","observation_id":"a234b00f-cd1a-41e5-87d0-0ac3ff12296f","resolution":{"observed_at":"2026-07-07T01:23:07.304868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.303211Z","title":"Swiftbrush v2: Make your one-step diffusion model better than its teacher,","venue":null,"work_id":"3699a3c4-7c54-4433-939b-fe57ba1f6e02","year":2024},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:ac67ec5929806f833bff5ec668d6261e43fa1c55d76de85c6e3e5b697efc0935","observation_id":"aaa167fc-e9b2-4255-bd6e-f0f614ed01c2","resolution":{"observed_at":"2026-07-07T01:23:07.304672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.307616Z","title":"Clotho: An audio captioning dataset,","venue":null,"work_id":"f82b797f-d4f4-4596-b4de-23f082b8e503","year":2020},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:5a9c9aeb7518851b44b657426137864e5ff0609c2cb1ef31093ec92e7a05fd25","observation_id":"0c131e16-0f6b-41d6-b6c7-5afd49369a9a","resolution":{"observed_at":"2026-07-07T01:23:07.309270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.341829Z","title":"Audiolm: A lan- guage modeling approach to audio generation,","venue":null,"work_id":"8773e819-39ee-4a31-adc3-ee44e0e5fb78","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:5ecdca33d9a5dae743d4670e297436b8375d0eb6af14167fc2c834da539b16c3","observation_id":"bc36acda-8e77-44d1-a3f6-0dcf8547c4e7","resolution":{"observed_at":"2026-07-07T01:23:07.343219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.299885Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation,","venue":null,"work_id":"bb4e4428-2d72-4efb-9705-6c04f5ef0b3b","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:654939e3d49908e910ed07e1aef3f6d003af4e9a05e60c86025d66f5fd355640","observation_id":"1d1c1db6-e338-40be-8b43-b8c7fdd30f06","resolution":{"observed_at":"2026-07-07T01:23:07.301107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.305434Z","title":"Improved techniques for training score- based generative models,","venue":null,"work_id":"67698a1f-32d1-4fbc-a3e0-278d7e6f371d","year":2020},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:8e999a13298260d777d4bdd28745871e8feaad685d3f98c0e86cc472e2b460dd","observation_id":"3ab76f2b-28f4-4b3c-9d41-7c62a4abd398","resolution":{"observed_at":"2026-07-07T01:23:07.306635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.293098Z","title":"Text-to-audio gen- eration using instruction guided latent diffusion model,","venue":null,"work_id":"78f6516a-0e40-4c84-b975-029a0ff051fb","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:a79fea5b543ca412fbc0dc3290769081469cf129b4fcf4dc0696439456252767","observation_id":"ce9a2467-275f-41c7-8a8c-ceb53551769b","resolution":{"observed_at":"2026-07-07T01:23:07.294478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.300932Z","title":"Diffwave: A versatile diffusion model for audio synthesis,","venue":null,"work_id":"79460442-cda9-445f-8275-0b8e18738135","year":2021},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:b15cd7e125f9ddd941be7d5af1bd4414c4c319b99dadc85760f8ca50bea374b9","observation_id":"da459659-1138-4f96-9d95-2aca7d617869","resolution":{"observed_at":"2026-07-07T01:23:07.302321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.305321Z","title":"Wave- grad: Estimating gradients for waveform generation,","venue":null,"work_id":"af1a3eb7-324b-4419-a42f-5ad7b0233bbb","year":2021},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:6574d5fd9bf00fd0a259af21776db6328114936d75e9da466070e38cd9462301","observation_id":"789d25a4-d230-4375-8818-5a5c360ce065","resolution":{"observed_at":"2026-07-07T01:23:07.307006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.295039Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":"d2960bc5-4f9c-40c6-a776-14c41d8b11cc","year":2022},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:e1a891bee0f2af6e74393f45ef46691eaae2531f96e0493ffbf24c75560c5032","observation_id":"87601a5d-2d35-48db-ab41-d9713bb0306b","resolution":{"observed_at":"2026-07-07T01:23:07.296572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.307175Z","title":"Pseudo numerical methods for diffusion models on manifolds","venue":null,"work_id":"8b635c87-86d4-4e5b-a269-a3669a074dc9","year":2022},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:8d5c6bb5f80d0197a414a2007551741b3cea45604e3aa74c4d5790801c40964c","observation_id":"be6dbe49-c11d-4e59-b529-b57578e5adfd","resolution":{"observed_at":"2026-07-07T01:23:07.308408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.283243Z","title":"Progressive distillation for fast sampling of diffusion models,","venue":null,"work_id":"1bcb7225-bc18-4b49-a9b3-0b676715d5a4","year":2022},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:99df85179bf83a4296c43905c352c6e33b2c36e39e5df92b44b2946023f87991","observation_id":"a0c3e79c-78bb-4cf8-9702-3bcc8732884e","resolution":{"observed_at":"2026-07-07T01:23:07.284468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.285130Z","title":"Dreamfusion: Text-to-3d using 2d diffusion,","venue":null,"work_id":"8534b913-d9f5-4359-ad12-06a32a952a6f","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:8d5196b1568206e71906359c6bd5edc1b869b234f077db5f11ae68878a8210f0","observation_id":"223603cc-ab08-4380-889e-67d9ff11200d","resolution":{"observed_at":"2026-07-07T01:23:07.286544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.287131Z","title":"Score jacobian chaining: Lifting pretrained 2d diffusion models for 3d generation,","venue":null,"work_id":"7d595246-9a54-45c9-a87a-c487d63a70da","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:c467b0256267f3c4bcf877d57c155d6df59e5df36cc818719ccc4662e7a806ce","observation_id":"0d4044a5-481a-4642-a0e2-76a719ae5961","resolution":{"observed_at":"2026-07-07T01:23:07.288395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.277454Z","title":"Magic3d: High-resolution text-to- 3d content creation,","venue":null,"work_id":"43b06fb8-a720-4b22-81fa-02f3fc189b9b","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:71114037e0fb21282d04501c1130608e6ab887d8e65cd6bdce8036c37aecb17c","observation_id":"bcfc807b-7570-4dd2-ae27-26f39dc238c4","resolution":{"observed_at":"2026-07-07T01:23:07.278698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.258781Z","title":"Latent-nerf for shape-guided generation of 3d shapes and textures,","venue":null,"work_id":"771261bd-691c-4832-a365-4480181fb5d4","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:7cb75e2ac6bbd9f36f0457d64b57b7bff23191bd1e57638289ca758a70e3ac2e","observation_id":"77f13f2e-3f87-4f52-82fe-41b860d7d387","resolution":{"observed_at":"2026-07-07T01:23:07.259937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.279343Z","title":"Fantasia3d: Disentangling geometry and appearance for high-quality text-to-3d content creation,","venue":null,"work_id":"12f7b102-efad-4e1f-a789-e2869326b98f","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:570de2faec070909aa5daa3bd2f11528bba21c27f4df89e0a5bf2f37f81dad2e","observation_id":"dd4afe92-b547-4ade-b482-e9efa7288a82","resolution":{"observed_at":"2026-07-07T01:23:07.280578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.273263Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"c7584f84-d177-4d19-9007-e06721d7f70c","year":2022},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:39ee67749d34acf0319ec22cb03b9bcd88938a8c649950aa9f697a3cecdf7fba","observation_id":"99fd5030-4c2e-4868-8fcb-2642dc5ad66b","resolution":{"observed_at":"2026-07-07T01:23:07.274475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:03:26.646762Z","title":"Nonlinear total variation based noise removal algorithms","venue":null,"work_id":"949d76fa-764e-4935-b765-97f9150dfee4","year":1992},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:9f06eb1b8d48b1ccae5177f360958ff9f79ba16c5bc95be00dd8354d2ec9388f","observation_id":"a4f16c29-6ad6-4037-9475-9f61d0ec565a","resolution":{"observed_at":"2026-07-07T01:23:07.261798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.349819Z","title":"A duality based approach for realtime tv-l 1 optical flow","venue":null,"work_id":"33e1a4fd-7d42-4aa9-8186-8a9edad8b692","year":2007},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:3ef6e9df590180578fd9837599f8d474033d7ca9dc750eef9b478ba5f2054e3e","observation_id":"96f26093-8399-48bd-8371-45709339df8a","resolution":{"observed_at":"2026-07-07T01:23:07.351427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.271179Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":"5bc5f5f9-bcd0-4f1b-a98d-d680f780362f","year":2021},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:0b4f46a7e5ea7913e4167747bb80c39223987bbd598f6c0ee2c29ed5ce8295e8","observation_id":"0203c610-71f9-4a7f-a7ed-88409025fc71","resolution":{"observed_at":"2026-07-07T01:23:07.272520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.267176Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"edfd9be0-302b-417b-a34d-3769df2fab78","year":null},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:49e973ad8be0babd6241a8cfe8621c6cb9bb0c1baa56f4bb9dc7fd091ff0ecec","observation_id":"8fffec2a-fe23-46f6-8929-0262afc4f7b1","resolution":{"observed_at":"2026-07-07T01:23:07.268441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.344245Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition","venue":null,"work_id":"d8be7b95-43ec-405f-82b0-0472f5dda417","year":2020},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:c18291935647bd2890cd13590827e15ca360672a5765aafa2cec838284c66c44","observation_id":"01c32da1-7a78-4783-a7e8-5acf733b18d1","resolution":{"observed_at":"2026-07-07T01:23:07.345855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.264922Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":"0e95f78b-eb2c-4b15-9deb-22cc07e74ea4","year":2017},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:e0045fa9defd16b755774a7fc7ec25b3ec11260eef5d452f0a97a4a6c7372994","observation_id":"f7563967-269c-47d5-8f3e-81c7b10add25","resolution":{"observed_at":"2026-07-07T01:23:07.266149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.285971Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"eb6b5482-7dd9-4eb6-aeaf-871026f282c1","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:e1865a592671fddf85b7191918fad9ecd93b1f8700f5e77ea23d41170abcdbba","observation_id":"e1f9f09c-2b45-46e7-8b2e-877fe5b466fa","resolution":{"observed_at":"2026-07-07T01:23:07.287372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.298799Z","title":"Supercharged one-step text-to-image diffusion models with negative prompts,","venue":null,"work_id":"0fa17d94-2c3d-466e-8371-036368181144","year":2025},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:d0c4298d1dbac7830d9ff016c5cdc76c0375b103607ee845e87a11b87db75e8f","observation_id":"c9f9d3cf-b0fb-4d07-9553-ba8f8c833a22","resolution":{"observed_at":"2026-07-07T01:23:07.300261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T01:23:07.281284Z","title":"Prompt-to-prompt image editing with cross-attention control,","venue":null,"work_id":"a38a066f-8efd-4270-91e5-2c365489f206","year":2023},"citing_paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-01T03:45:40.636290Z"},"links":{"citing_paper":"/paper/2606.31259"},"observation_digest":"sha256:8277f1f958c12fc8cc5249932d272aa0bb6d218555201fa6b59e8d81e9e8e1af","observation_id":"a9eb15af-54cc-46b1-bf8e-393e7099ffdf","resolution":{"observed_at":"2026-07-07T01:23:07.282667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.31259","last_updated":"2026-06-30T07:36:10Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T12:34:46.615709Z","submitted_at":"2026-06-30T07:36:10Z","title":"SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2606.31259."}