Pith. sign in

Paper Citation Record · LEDGER

MMAE: A Massive Multitask Audio Editing Benchmark

As of 6 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2606.07229.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.07229 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-27T21:02:04.021977Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-31T15:38:32.786994Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

31 of 31 outbound references displayed

  • verified exact14
  • verified fuzzy0
  • unresolved15
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 24629961-3d15-4f16-9e62-a79a951a5d87 · outbound

This paper cites Nano Banana 2: Google’s latest AI image generation model., 2026.

MMAE: A Massive Multitask Audio Editing Benchmark Nano Banana 2: Google’s latest AI image generation model., 2026

Reference 1

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:4ef9735751de69676bc0f58764fe21abc0c691fad53b44b6745fc79644094015

Observation 4944dca6-00f5-4d3b-b708-a98ec6736ecb · outbound

This paper cites Gemini Omni: Native multimodal generation and video model., 2026.

MMAE: A Massive Multitask Audio Editing Benchmark Gemini Omni: Native multimodal generation and video model., 2026

Reference 2

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:32245d3e6eb7201cb79da782d7d1bd26b5bd02db3bf7f989ff33f74e00ab7055

Observation 908bdb12-5b54-4c8f-b202-c6134f2858ef · outbound

This paper cites Guiding audio editing with audio language model.

MMAE: A Massive Multitask Audio Editing Benchmark Guiding audio editing with audio language model

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:efac3c12997d04ca9557b18bda99ee05cb6681760484b0358a364709a20df628

Observation 1448b5ec-527f-4ecb-9861-eb8fbeb13edf · outbound

This paper cites Mmedit: A unified framework for multi-type audio editing via audio language model,.

MMAE: A Massive Multitask Audio Editing Benchmark Mmedit: A unified framework for multi-type audio editing via audio language model,

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-07-02T20:07:21.626384Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:3650b64bd852e2e65d1afbc8a58b353a5a9101e6a823c6b77497c0d5f2cc058a

Observation 511ea7c9-f983-4344-8af4-035b527c6965 · outbound

This paper cites Ming-uniaudio: Speech llm for joint understanding, generation and editing with unified representation.

MMAE: A Massive Multitask Audio Editing Benchmark Ming-uniaudio: Speech llm for joint understanding, generation and editing with unified representation

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-02T20:07:21.623010Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:655420b35f0dbd8ba2eda8966d99407983906ccf1e5c4cf4805e987f7142ca77

Observation 7c26e1b0-4d6a-45da-9476-e7f08e184aad · outbound

This paper cites Step-audio-editx technical report.

MMAE: A Massive Multitask Audio Editing Benchmark Step-audio-editx technical report

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-07-02T20:07:21.642619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:4c5a457c61076de2a58a525d52db0ff55adff5f7ef76c59c1f6e990a902145bf

Observation 2736e59b-65a2-4b86-ba67-73e3eb2c443f · outbound

This paper cites Audiochat: Unified audio sto- rytelling, editing, and understanding with transfusion forcing,.

MMAE: A Massive Multitask Audio Editing Benchmark Audiochat: Unified audio sto- rytelling, editing, and understanding with transfusion forcing,

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-07-02T20:07:21.633174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:3b319a47493d2d70730ea7349ef28eccb861c068c7293abaddb759422c379501

Observation 65371372-0a0b-4c25-9c73-8416bba30717 · outbound

This paper cites Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing.

MMAE: A Massive Multitask Audio Editing Benchmark Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Reference 8

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:0efb9b768aee05393363a30c8e967d6b6bdfb13fc8effcb97411f23fa16a36be

Observation 46f2db77-7b18-4051-ac78-0da88f7d4c6f · outbound

This paper cites Voicecraft: Zero-shot speech editing and text-to-speech in the wild.

MMAE: A Massive Multitask Audio Editing Benchmark Voicecraft: Zero-shot speech editing and text-to-speech in the wild

Reference 9

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:367cb00602faaf5fdca53fb0e5c0717058a5bf3bc6d10937542ff0ca919dcf8d

Observation 7a53f7f4-c286-4d21-b417-d03c4f5eaede · outbound

This paper cites Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains.

MMAE: A Massive Multitask Audio Editing Benchmark Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-07-02T20:07:21.600678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:a513814b75cfb219cd78b5b5142a3a3dbef3b424d514a715ebeb99a03e6682f0

Observation b6e32a0a-eff3-41b7-b4f3-d7f8e6631ce6 · outbound

This paper cites The interspeech 2026 audio reasoning chal- lenge: Evaluating reasoning process quality for audio reasoning models and agents.

MMAE: A Massive Multitask Audio Editing Benchmark The interspeech 2026 audio reasoning chal- lenge: Evaluating reasoning process quality for audio reasoning models and agents

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-02T20:07:21.613310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:4e08fe23263b8c9878bd39afa78057e1506db0abb3cc3a085c30767700fe29d3

Observation e5ceee80-3aab-4981-815e-e39da6559633 · outbound

This paper cites Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling.

MMAE: A Massive Multitask Audio Editing Benchmark Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-07-02T20:07:21.609911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:fd4cb394abf1eacbe01df6058b36eb455eccd997c72ced794ddcd42ccc339a9c

Observation 5c5ab581-eeb1-4024-a142-e0af8a4f9780 · outbound

This paper cites Fluentspeech: Stutter- oriented automatic speech editing with context-aware diffusion models.

MMAE: A Massive Multitask Audio Editing Benchmark Fluentspeech: Stutter- oriented automatic speech editing with context-aware diffusion models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:a8391efe39269723d4a99c13391be30faba0ac228fcdd205c2ed0857080b1098

Observation 173652ec-d260-4c50-bdd1-f6c21dbb0334 · outbound

This paper cites Ssr-speech: T owards stable, safe and robust zero-shot text-based speech editing and synthesis.

MMAE: A Massive Multitask Audio Editing Benchmark Ssr-speech: T owards stable, safe and robust zero-shot text-based speech editing and synthesis

Reference 14

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:2e93eab9311fc02805e59de93afead6c75ba76f4abd87cf0c2da5e230ab65333

Observation e49812c5-c163-4796-881b-ab1cb714c36c · outbound

This paper cites Recomposer: Event-roll-guided generative audio editing.

MMAE: A Massive Multitask Audio Editing Benchmark Recomposer: Event-roll-guided generative audio editing

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-07-02T20:07:21.619554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:a757aa891c5463ee118b3fe9f8f1b62bbe7c726f1f62bdc3bc5cbcc76755670f

Observation f94d8411-ddf2-48ed-9a7c-0d494c25f213 · outbound

This paper cites Prompt-guided precise audio editing with diffusion models.

MMAE: A Massive Multitask Audio Editing Benchmark Prompt-guided precise audio editing with diffusion models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:7f70be63deb44d898113a585e676b2d05fb6e03c6857ffb787a87fb154426992

Observation 71cb0130-9758-44af-b716-9be88c10ede9 · outbound

This paper cites Zero-shot unsupervised and text-based audio editing using DDPM inversion.

MMAE: A Massive Multitask Audio Editing Benchmark Zero-shot unsupervised and text-based audio editing using DDPM inversion

Reference 17

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:8687f9cd9bcf59f9d618c186e1936efe17852825215e1e952ad82fcf7d5901e6

Observation 2a896a11-11aa-4042-abf7-e1de48272e99 · outbound

This paper cites Instructspeech: Following speech editing instructions via large language models.

MMAE: A Massive Multitask Audio Editing Benchmark Instructspeech: Following speech editing instructions via large language models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:0d13489a47823c111bf3ca7dfd7e9229585417a6edd6751fd42e2d53c545252f

Observation 4c41a948-3bf0-4c50-abe6-82abf5d5b579 · outbound

This paper cites WavCraft: Audio Editing and Generation with Large Language Models.

MMAE: A Massive Multitask Audio Editing Benchmark WavCraft: Audio Editing and Generation with Large Language Models

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-07-02T20:07:21.603571Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:c9c1ff419fb93029f1da0ea63ad389c40177a4031141b5f0c374b6e7e327a1aa

Observation 242ed538-66b8-4ad5-a0ed-379822119b49 · outbound

This paper cites Audit: Audio editing by following instructions with latent diffusion models.

MMAE: A Massive Multitask Audio Editing Benchmark Audit: Audio editing by following instructions with latent diffusion models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:7210e2467af5767306717cc01f30d9e93bbe659545d35e5133ea4764cd22ff85

Observation 3c2be435-a2a6-4130-a2de-37583994c917 · outbound

This paper cites Audioeditor: A training-free diffusion-based audio editing framework.

MMAE: A Massive Multitask Audio Editing Benchmark Audioeditor: A training-free diffusion-based audio editing framework

Reference 21

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:f3c5260da4cfbfbb60c65ebf51baebb542af09e401077577fbdf073becb6db88

Observation 1e3d45a2-4f8b-4179-b483-6f334cfb80f6 · outbound

This paper cites AudioMorphix: Training-free audio editing with diffusion probabilistic models.

MMAE: A Massive Multitask Audio Editing Benchmark AudioMorphix: Training-free audio editing with diffusion probabilistic models

Reference 22

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T20:07:21.605843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:77d3c4d18e9bbdf5af3b225df749a84c2b824c5775962f28a99d2758ef4cdfd9

Observation 004d4398-a5b1-46a4-b97a-a9d5c99bd38a · outbound

This paper cites VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing.

MMAE: A Massive Multitask Audio Editing Benchmark VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing

Reference 23

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:e387944dc265f0d32594cb130b8e757c2f51ca502479695eabfcd920989d1b5f

Observation 8d311cd7-530d-45b2-8829-db578420ddd0 · outbound

This paper cites CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models.

MMAE: A Massive Multitask Audio Editing Benchmark CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-07-02T20:07:21.616926Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:68800e9f1df4cb22490176af696b7e56d9e9f8fdd4d0024ab65667268fb715a2

Observation 0e8c4fdf-8e7f-4f00-9572-c79cf55e14c6 · outbound

This paper cites InstructAV2AV: Instruction-Guided Audio-Video Joint Editing.

MMAE: A Massive Multitask Audio Editing Benchmark InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

Reference 25

Resolution
verified exact
local_arxiv, observed 2026-07-02T20:07:21.645062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:67b55b52c328c1903713243ea4995c6e384111cb692e13fb13b8024ab12cc055

Observation f3b64323-eb9d-4c46-a72a-2bf434cef0be · outbound

This paper cites SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing.

MMAE: A Massive Multitask Audio Editing Benchmark SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-07-02T20:07:21.636623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:51355cc135edc6481a3d60423e4ced64603f2e427bcb1a72a074ee73e35968b3

Observation 45b72c30-3e4f-46ea-90ae-8345a5d86c71 · outbound

This paper cites Flam: Frame-wise language-audio modeling.

MMAE: A Massive Multitask Audio Editing Benchmark Flam: Frame-wise language-audio modeling

Reference 27

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:488e835ca270e1e0fc24a2b7d82ecfda2e389921d359f153a5524759cb71a17c

Observation c143df92-39d7-4394-85f2-565de928ec65 · outbound

This paper cites Omni-captioner: Data pipeline, models, and benchmark for omni detailed perception.

MMAE: A Massive Multitask Audio Editing Benchmark Omni-captioner: Data pipeline, models, and benchmark for omni detailed perception

Reference 28

Resolution
unresolved
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:5b292b15146d14fdfafd0e832b2b4e2ac86097c15c396a5c28348203eafcd60a

Observation 69a7bd31-4b73-49a8-8da1-e88c97e3bc53 · outbound

This paper cites Qwen3-Omni Technical Report.

MMAE: A Massive Multitask Audio Editing Benchmark Qwen3-Omni Technical Report

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-07-02T20:07:21.629216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:3bdb3cd8f82d56947e9b0a8672c2675dc80d3804b04998732e11cface99b6fb4

Observation e2085551-2634-4c86-a5c1-f91bad2e3bd9 · outbound

This paper cites Qwen3.5-Omni Technical Report.

MMAE: A Massive Multitask Audio Editing Benchmark Qwen3.5-Omni Technical Report

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-07-02T20:07:21.639606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:14b2d2a74acf7692db57517504d2f55d9397e9b29f9372c5b3867efdaaebeb70

Observation 880df646-a006-4570-8207-b0da9a2ff514 · outbound

This paper cites id": "69e898163a050f39ac567501.

MMAE: A Massive Multitask Audio Editing Benchmark id": "69e898163a050f39ac567501

Reference 31

Resolution
malformed identifier
no resolver link, observed 2026-06-27T21:02:04.021977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T21:02:04.021977Z digest=sha256:c5b44d4a33caad82bc954fade9237b38d0801eb7540acf09f7855d222729b5b8

Pith citing papers

Observation 554ce836-3db2-4da5-8e18-af27c14b8e05 · inbound

AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach cites this paper.

AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach MMAE: A Massive Multitask Audio Editing Benchmark

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-07-31T15:38:32.786994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T15:38:32.786994Z digest=sha256:95c0074298efd251e88299d6d7a213ff3ab749e6cb8a8578220ac90fee021ce7