{"as_of":"2026-08-12T13:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e0526aadce5c543b55d33650f6e5a6bb856ffef2c966dcb47ce3ae2bb201f3d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T20:52:26.812505Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.07356/citation-record","integrity":"/paper/2606.07356/integrity","json":"/paper/2606.07356/citation-record.json","paper":"/paper/2606.07356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Zero-Shot Unsupervised and Text-Based Audio Editing Using","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:1eba358a7e7df41ebeed78b1665134c148e8599972e64aa95527490c4bebe473","observation_id":"3ab35fd4-7d5d-475e-99b8-f5b0f24b8420","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:b429c5d6f90655f41513c81a95eb32bab492fa7c353a90a5cba1d009a9a8a2eb","observation_id":"7f5379f5-db75-4284-a191-6b6971f90e3c","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Separate anything you describe , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:f87877743c099afda3ebf6de664bca28ee41009ba7d36138085bce921b8944a5","observation_id":"9aa1dcf4-0b9f-43e4-b0b5-3a12f293dac1","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretraining , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:bcf28f79ec4e702807e0108a60bda9945470bdef9d5de665798d87cb05eebc48","observation_id":"e9b0ed47-9d02-4887-8996-1953bccf8e12","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Mandic and Wenwu Wang and Mark D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:ebdd3bc15cc384fcd68ad1e3cd4a08877cfc8f2e864d8d17a1fa249ead2a8f33","observation_id":"72d8e8df-57ad-4cac-a2fa-a882d03bd652","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:27309a259f0cee89ade58543e740398be6b68942a2ec0c03caf8d4b4b3ecbaa2","observation_id":"9a90a4ea-b23b-46da-93ad-1dde462ae46d","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Audioeditor: A training-free diffusion-based audio editing framework , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:56a7902295e481a8d8c6a92af3416c26a1d4ca4be20d69b4f7f2c4a9c5262090","observation_id":"c4b541b2-c7c9-41a3-978e-da68a9dbcead","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:554ca547c7cfc648fc09222f61fb51bf22a47d396e2b3a4c10f3853ab5583e92","observation_id":"f637a2be-c8e5-4efd-a57d-bb60d619297b","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:225fe1d4f2b52388f425a4b40a5b1ef92d33bc716722d44f23c547ebb17a9ef4","observation_id":"4541ea1e-636c-404b-a178-925fd3552415","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Flowedit: Inversion-free text-based editing using pre-trained flow models , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:4870ec0492e712ef623103609c62e3cdd8a5c8ac6c22d48717b45c718a4e1965","observation_id":"ad320ebc-3094-4c88-bc84-69a2e79a96e0","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1011","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A udio C aps: Generating captions for audios in the wild","venue":null,"work_id":"1ac1fac9-c7ba-4b7f-950f-1ad9b6bfe9e9","year":2019},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:e0caef545f0fdb40c79a4494b118506536a3b90b31d601578d74e347ff9f96c6","observation_id":"9a8ac4cd-8e13-49e7-b25d-943c7d5f001f","resolution":{"observed_at":"2026-06-27T22:51:22.371826Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9357.2023","doi":"10.1109/icassp49357.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: ICASSP 2023 - 2023 IEEE Inter- national Conference on Acoustics, Speech and Signal Processing (ICASSP), pp","venue":null,"work_id":"d4aa6117-860d-404b-ac11-39169a0ac02c","year":2023},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:45d67eacf9ca9eeb829810487761ea92390ba6cc2059fdbbea74245d74bad494","observation_id":"ec7bc1ba-0f72-44d3-998c-fd4031357486","resolution":{"observed_at":"2026-06-27T22:51:22.374364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:4f9d6293bdbc42a816a37f3b9638708b14f4b64f2fd70a58b4e19facc6168a05","observation_id":"7d7e6c6e-2d03-4947-96ff-8f23fd59f501","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:01d25388155cb9872559080a3f6d344f26a5c441d4eacbf1be6f65281486d2a5","observation_id":"1efcab7c-9aa1-4d1f-b26c-da9dbd176ebc","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"InstructME: An Instruction Guided Music Edit Framework with Latent Diffusion Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:9927f0e55931ff8861652344eb25c1f12d5197a46c1cce83752af115e6e482cb","observation_id":"39a41f62-d53d-460e-8753-5b6eef917e41","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"InstructSpeech: Following Speech Editing Instructions via Large Language Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:5ffeb85555df408fb6a0c4ed7a50a5c2af5e6ba702d16aadb482278d983fcde2","observation_id":"f07a119d-7444-49c1-97cd-afbaaf15005a","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Steermusic: Enhanced musical consistency for zero-shot text-guided and personalized music editing , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:966c4d3095f6831c28892916fdff007b29119741c35310bef376f174b1321c9f","observation_id":"717df371-86a6-4911-a189-a1ae7cc73b3f","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:f390971d414336fdaf36b3a72062ccc19dd15d70fbac33a50f66652145d01c42","observation_id":"152fee70-6e59-4ff0-ac0f-b0c7e53530c1","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Classifier-Free Diffusion Guidance , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:0a91cd36fd716369832d58477541471b5fef1745863891c60b7fcc71806af674","observation_id":"5a89c7c3-ad0b-467e-bc50-c966f09bdbc9","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:79d94918caa7ff91de04d1e4114606f7b299bc56fac426e9ccad8c87d79d3e83","observation_id":"37615aeb-08af-46ce-bfee-d626136f9928","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Goodfellow and Wojciech Zaremba and Vicki Cheung and Alec Radford and Xi Chen , bibsource =","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:d77bd8b7607e51196ac9356f3ebc34ed8c570c20b2fa7b21828a2190b871fb74","observation_id":"e9966058-2c1a-4af0-aca4-03e6418fdda5","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Image quality assessment: from error visibility to structural similarity , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:d720446d487d2e883d25ec92eaa20f0aab20ff45de3bbea20e3780c430bd2892","observation_id":"9b27da6e-16cb-49b5-9c5b-e82c2c1a5bd2","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Comparing individual means in the analysis of variance , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:92516d208346b1b51e31be8a73dc856360e2fd3de7d63df41fa1a87e16bb1f22","observation_id":"0a784be8-943d-4144-9749-de86d3fe5e71","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"DeepSeek-V3 Technical Report , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:cb79f8cd61464c6d317c648e567e03c56a4abf9b288b8dc43245a5b49d30f1b5","observation_id":"7b981bf0-9aba-442f-915c-24fabbd9c2d0","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"AudioMorphix: Training-free audio editing with diffusion probabilistic models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:1fbe14d57f5686a55fe3672601640de16bcbde6f882f90106924f72b4a8b9796","observation_id":"1a7fa51c-5978-4f8a-92d0-cd6d23458c75","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:d4cb67814ac872efb1d3582cd6ec07c738ea53e63a8fdf63812d6b2bfc4d86c3","observation_id":"c8a24ac6-af8a-4bb7-99dc-36c635fec41e","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2733.2024","doi":"10.1109/cvpr52733.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emogen: Emotional image content generation with text-to-image diffusion models","venue":null,"work_id":"7efbc2dd-b0f2-4f71-bb1c-d2fcf110d805","year":2024},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:8b668c4d4209440d581f6afb19fea41f5c9bb438b180421300f2fa38fe924b5d","observation_id":"d7dbb0c2-1d8c-4f9e-a302-f2fa7ac3cd74","resolution":{"observed_at":"2026-06-27T22:51:22.379612Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2729.2023","doi":"10.1109/cvpr52729.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"b9701eca-d05e-4d2e-9045-6761df4ba175","year":2023},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:0e0bbf319162aacf4b010f30067f3336d5c3dafd260f9c0b18e23e2f7adc8b9a","observation_id":"af8edf29-5b0e-4570-9735-16d81fcebe9f","resolution":{"observed_at":"2026-06-27T22:51:22.376959Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-12T01:51:17.845486+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T01:51:17.845486+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"SteerFlow: Steering Rectified Flows for Faithful Inversion-Based Image Editing , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:991eb23c0386b63c6022548fafa61847dfd2d8107e5ff882ba54dbe0c7118daf","observation_id":"3364943a-27c5-4402-b243-035296bca026","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Flowalign: Trajectory-regularized, inversion-free flow-based image editing , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:d1e252e56d7845ee939f644cad5f14b36f6ae33ccb7f3cc1287a0078d72a3a8a","observation_id":"861fa5ea-707b-4c01-b98b-e9b2ac67077d","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Advances in text-guided 3D editing: a survey , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:5846ceae3fdeedade52e06368650a0f000bd7ce443911de0ad4aa76a41232c46","observation_id":"a1235c27-4731-4500-a9ae-33d02197bce0","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:ef8e0d2587ee1222e8d67d6de4ebb02715928dac006c7385951839498f2f4b12","observation_id":"c05f1be6-d320-4ea4-8433-30167c8914af","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Diffusion model-based image editing: A survey , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:b9e3c0c3f8148bb2189766dde590ad1ac35b6ce6d8b5a1772183d1a176584422","observation_id":"ff9b7ce7-1785-4c0e-9e77-ada0019440c3","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Guiding audio editing with audio language model , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:f369656c9ef43b98e8b75140c32d7f3dc4d469e08b4831773e93769dbe172c38","observation_id":"b7e5de5f-ab52-4191-a4d0-6c7964866d21","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"WavCraft: Audio editing and generation with large language models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:e1cbf23a798760fb51f1cdb220777d97e802a46a202798ec32b2c2a696494c3f","observation_id":"2e59e7de-49ef-42b6-b8b5-116f3f755bb6","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:52:26.812505Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T20:52:26.812505Z"},"links":{"citing_paper":"/paper/2606.07356"},"observation_digest":"sha256:4ba12d244dad4721a32d6fcec5d6e44d704ce7af7d9e9aa67991fe6296a41b02","observation_id":"8dcb46b4-6d0a-4b3e-b1b1-2fd361392ac7","resolution":{"observed_at":"2026-06-27T20:52:26.812505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.07356","last_updated":"2026-06-05T15:04:22Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T15:31:43.368376Z","submitted_at":"2026-06-05T15:04:22Z","title":"DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2606.07356."}