{"as_of":"2026-08-06T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:412d95b72ed62b2220c3b730f7a14106648c64d8c5a3d48b111428d92da1af9c","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:02:04.021977Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T15:38:32.786994Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07229","snapshot_observed_at":"2026-07-31T15:38:32.786994Z","title":"Marie, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28175","last_updated":"2026-07-30T13:12:25Z","snapshot_observed_at":"2026-08-03T04:52:18.523406Z","submitted_at":"2026-07-30T13:12:25Z","title":"AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T15:38:32.786994Z"},"links":{"cited_paper":"/paper/2606.07229","citing_paper":"/paper/2607.28175"},"observation_digest":"sha256:95c0074298efd251e88299d6d7a213ff3ab749e6cb8a8578220ac90fee021ce7","observation_id":"554ce836-3db2-4da5-8e18-af27c14b8e05","resolution":{"observed_at":"2026-07-31T15:38:32.786994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.07229/citation-record","integrity":"/paper/2606.07229/integrity","json":"/paper/2606.07229/citation-record.json","paper":"/paper/2606.07229"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Nano Banana 2: Google’s latest AI image generation model., 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:4ef9735751de69676bc0f58764fe21abc0c691fad53b44b6745fc79644094015","observation_id":"24629961-3d15-4f16-9e62-a79a951a5d87","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Gemini Omni: Native multimodal generation and video model., 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:32245d3e6eb7201cb79da782d7d1bd26b5bd02db3bf7f989ff33f74e00ab7055","observation_id":"4944dca6-00f5-4d3b-b708-a98ec6736ecb","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Guiding audio editing with audio language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:efac3c12997d04ca9557b18bda99ee05cb6681760484b0358a364709a20df628","observation_id":"908bdb12-5b54-4c8f-b202-c6134f2858ef","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.20339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T05:39:39.390352Z","title":"Mmedit: A unified framework for multi-type audio editing via audio language model,","venue":null,"work_id":"c96f839c-67f2-403b-ac4d-032bc6cffb98","year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:3650b64bd852e2e65d1afbc8a58b353a5a9101e6a823c6b77497c0d5f2cc058a","observation_id":"1448b5ec-527f-4ecb-9861-eb8fbeb13edf","resolution":{"observed_at":"2026-07-02T20:07:21.626384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05516","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.830598Z","title":"Ming-uniaudio: Speech llm for joint understanding, generation and editing with unified representation","venue":null,"work_id":"11c153e9-984d-4efa-a9d8-c056545c0042","year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:655420b35f0dbd8ba2eda8966d99407983906ccf1e5c4cf4805e987f7142ca77","observation_id":"511ea7c9-f983-4344-8af4-035b527c6965","resolution":{"observed_at":"2026-07-02T20:07:21.623010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:39:38.491718Z","title":"Step-audio-editx technical report","venue":null,"work_id":"72708f56-8cbe-49d9-a132-7fb2895ef10e","year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:4c5a457c61076de2a58a525d52db0ff55adff5f7ef76c59c1f6e990a902145bf","observation_id":"7c26e1b0-4d6a-45da-9476-e7f08e184aad","resolution":{"observed_at":"2026-07-02T20:07:21.642619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.17097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:19:47.955306Z","title":"Audiochat: Unified audio sto- rytelling, editing, and understanding with transfusion forcing,","venue":null,"work_id":"c0d75878-9ad1-4306-8c8f-a83d6ee4c278","year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:3b319a47493d2d70730ea7349ef28eccb861c068c7293abaddb759422c379501","observation_id":"2736e59b-65a2-4b86-ba67-73e3eb2c443f","resolution":{"observed_at":"2026-07-02T20:07:21.633174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:0efb9b768aee05393363a30c8e967d6b6bdfb13fc8effcb97411f23fa16a36be","observation_id":"65371372-0a0b-4c25-9c73-8416bba30717","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Voicecraft: Zero-shot speech editing and text-to-speech in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:367cb00602faaf5fdca53fb0e5c0717058a5bf3bc6d10937542ff0ca919dcf8d","observation_id":"46f2db77-7b18-4051-ac78-0da88f7d4c6f","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:a513814b75cfb219cd78b5b5142a3a3dbef3b424d514a715ebeb99a03e6682f0","observation_id":"7a53f7f4-c286-4d21-b417-d03c4f5eaede","resolution":{"observed_at":"2026-07-02T20:07:21.600678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14224","doi":"10.48550/arxiv.2602.14224","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The interspeech 2026 audio reasoning chal- lenge: Evaluating reasoning process quality for audio reasoning models and agents","venue":"Open MIND","work_id":"235d1022-58e5-4528-8ba4-9e2e87a97242","year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:4e08fe23263b8c9878bd39afa78057e1506db0abb3cc3a085c30767700fe29d3","observation_id":"b6e32a0a-eff3-41b7-b4f3-d7f8e6631ce6","resolution":{"observed_at":"2026-07-02T20:07:21.613310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13062","last_updated":"2026-05-13T06:33:54Z","snapshot_observed_at":"2026-08-02T05:13:16.597072Z","submitted_at":"2026-05-13T06:33:54Z","title":"Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling","version":1},"cited_work":{"arxiv_id":"2605.13062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.13062","snapshot_observed_at":"2026-07-02T20:07:21.607257Z","title":"Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling","venue":"cs.CV","work_id":"b5783e0e-8adb-4ff9-973b-987bd5d5f822","year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2605.13062","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:fd4cb394abf1eacbe01df6058b36eb455eccd997c72ced794ddcd42ccc339a9c","observation_id":"e5ceee80-3aab-4981-815e-e39da6559633","resolution":{"observed_at":"2026-07-02T20:07:21.609911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Fluentspeech: Stutter- oriented automatic speech editing with context-aware diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:a8391efe39269723d4a99c13391be30faba0ac228fcdd205c2ed0857080b1098","observation_id":"5c5ab581-eeb1-4024-a142-e0af8a4f9780","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Ssr-speech: T owards stable, safe and robust zero-shot text-based speech editing and synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:2e93eab9311fc02805e59de93afead6c75ba76f4abd87cf0c2da5e230ab65333","observation_id":"173652ec-d260-4c50-bdd1-f6c21dbb0334","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05256","last_updated":"2025-09-05T17:14:29Z","snapshot_observed_at":"2026-08-05T05:32:33.324363Z","submitted_at":"2025-09-05T17:14:29Z","title":"Recomposer: Event-roll-guided generative audio editing","version":1},"cited_work":{"arxiv_id":"2509.05256","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.05256","snapshot_observed_at":"2026-07-02T20:07:21.617859Z","title":"Recomposer: Event-roll-guided generative audio editing","venue":null,"work_id":"d2046684-1e81-4f75-8447-ef12a90871a4","year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2509.05256","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:a757aa891c5463ee118b3fe9f8f1b62bbe7c726f1f62bdc3bc5cbcc76755670f","observation_id":"e49812c5-c163-4796-881b-ab1cb714c36c","resolution":{"observed_at":"2026-07-02T20:07:21.619554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Prompt-guided precise audio editing with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:7f70be63deb44d898113a585e676b2d05fb6e03c6857ffb787a87fb154426992","observation_id":"f94d8411-ddf2-48ed-9a7c-0d494c25f213","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Zero-shot unsupervised and text-based audio editing using DDPM inversion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:8687f9cd9bcf59f9d618c186e1936efe17852825215e1e952ad82fcf7d5901e6","observation_id":"71cb0130-9758-44af-b716-9be88c10ede9","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Instructspeech: Following speech editing instructions via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:0d13489a47823c111bf3ca7dfd7e9229585417a6edd6751fd42e2d53c545252f","observation_id":"2a896a11-11aa-4042-abf7-e1de48272e99","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09527","last_updated":"2024-05-10T07:54:17Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T16:10:34Z","title":"WavCraft: Audio Editing and Generation with Large Language Models","version":3},"cited_work":{"arxiv_id":"2403.09527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.09527","snapshot_observed_at":"2026-07-02T20:07:21.601592Z","title":"WavCraft: Audio editing and generation with large language models","venue":null,"work_id":"d8d7f686-27e3-414f-9108-dddaecf81c75","year":2024},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2403.09527","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:c9c1ff419fb93029f1da0ea63ad389c40177a4031141b5f0c374b6e7e327a1aa","observation_id":"4c41a948-3bf0-4c50-abe6-82abf5d5b579","resolution":{"observed_at":"2026-07-02T20:07:21.603571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Audit: Audio editing by following instructions with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:7210e2467af5767306717cc01f30d9e93bbe659545d35e5133ea4764cd22ff85","observation_id":"242ed538-66b8-4ad5-a0ed-379822119b49","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Audioeditor: A training-free diffusion-based audio editing framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:f3c5260da4cfbfbb60c65ebf51baebb542af09e401077577fbdf073becb6db88","observation_id":"3c2be435-a2a6-4130-a2de-37583994c917","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16076","last_updated":"2025-05-21T23:23:37Z","snapshot_observed_at":"2026-07-06T21:28:10.731408Z","submitted_at":"2025-05-21T23:23:37Z","title":"AudioMorphix: Training-free audio editing with diffusion probabilistic models","version":1},"cited_work":{"arxiv_id":"2505.16076","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16076","snapshot_observed_at":"2026-07-04T12:09:49.459974Z","title":"Jinhua Liang, Yuanzhe Chen, Yi Yuan, Dongya Jia, Xiaobin Zhuang, Zhuo Chen, Yuping Wang, and Yux- uan Wang","venue":null,"work_id":"c137244a-a3d6-4491-acfc-5d4a396a0850","year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2505.16076","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:77d3c4d18e9bbdf5af3b225df749a84c2b824c5775962f28a99d2758ef4cdfd9","observation_id":"1e3d45a2-4f8b-4179-b483-6f334cfb80f6","resolution":{"observed_at":"2026-07-02T20:07:21.605843Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"VoiceCraft-X: Unifying Multilingual, Voice-Cloning Speech Synthesis and Speech Editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:e387944dc265f0d32594cb130b8e757c2f51ca502479695eabfcd920989d1b5f","observation_id":"004d4398-a5b1-46a4-b97a-a9d5c99bd38a","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05329","last_updated":"2026-06-28T13:33:39Z","snapshot_observed_at":"2026-08-03T11:46:10.525808Z","submitted_at":"2026-01-08T19:16:27Z","title":"CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models","version":2},"cited_work":{"arxiv_id":"2601.05329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.05329","snapshot_observed_at":"2026-07-04T12:09:49.437611Z","title":"CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models","venue":"cs.SD","work_id":"43f2902f-60df-4313-b5f0-a64d350617c4","year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2601.05329","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:68800e9f1df4cb22490176af696b7e56d9e9f8fdd4d0024ab65667268fb715a2","observation_id":"8d311cd7-530d-45b2-8829-db578420ddd0","resolution":{"observed_at":"2026-07-02T20:07:21.616926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18467","last_updated":"2026-05-18T14:27:05Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:27:05Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","version":1},"cited_work":{"arxiv_id":"2605.18467","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18467","snapshot_observed_at":"2026-07-02T20:07:21.643376Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","venue":"cs.CV","work_id":"b5cbaf18-d8f3-4f1d-b289-9931788226fb","year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2605.18467","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:67b55b52c328c1903713243ea4995c6e384111cb692e13fb13b8024ab12cc055","observation_id":"0e8c4fdf-8e7f-4f00-9572-c79cf55e14c6","resolution":{"observed_at":"2026-07-02T20:07:21.645062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25193","last_updated":"2026-05-29T13:55:41Z","snapshot_observed_at":"2026-08-02T06:28:29.008131Z","submitted_at":"2026-05-24T17:50:45Z","title":"SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing","version":2},"cited_work":{"arxiv_id":"2605.25193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25193","snapshot_observed_at":"2026-07-04T13:09:51.176013Z","title":"SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing","venue":"cs.CV","work_id":"46b8d6a0-ef31-4042-8540-fd04ccf89e9e","year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2605.25193","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:51355cc135edc6481a3d60423e4ced64603f2e427bcb1a72a074ee73e35968b3","observation_id":"f3b64323-eb9d-4c46-a72a-2bf434cef0be","resolution":{"observed_at":"2026-07-02T20:07:21.636623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Flam: Frame-wise language-audio modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:488e835ca270e1e0fc24a2b7d82ecfda2e389921d359f153a5524759cb71a17c","observation_id":"45b72c30-3e4f-46ea-90ae-8345a5d86c71","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"Omni-captioner: Data pipeline, models, and benchmark for omni detailed perception","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:5b292b15146d14fdfafd0e832b2b4e2ac86097c15c396a5c28348203eafcd60a","observation_id":"c143df92-39d7-4394-85f2-565de928ec65","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:3bdb3cd8f82d56947e9b0a8672c2675dc80d3804b04998732e11cface99b6fb4","observation_id":"69a7bd31-4b73-49a8-8da1-e88c97e3bc53","resolution":{"observed_at":"2026-07-02T20:07:21.629216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:14b2d2a74acf7692db57517504d2f55d9397e9b29f9372c5b3867efdaaebeb70","observation_id":"e2085551-2634-4c86-a5c1-f91bad2e3bd9","resolution":{"observed_at":"2026-07-02T20:07:21.639606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T21:02:04.021977Z","title":"id\": \"69e898163a050f39ac567501","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T21:02:04.021977Z"},"links":{"citing_paper":"/paper/2606.07229"},"observation_digest":"sha256:c5b44d4a33caad82bc954fade9237b38d0801eb7540acf09f7855d222729b5b8","observation_id":"880df646-a006-4570-8207-b0da9a2ff514","resolution":{"observed_at":"2026-06-27T21:02:04.021977Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.07229","last_updated":"2026-06-05T12:52:41Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:46:55.970997Z","submitted_at":"2026-06-05T12:52:41Z","title":"MMAE: A Massive Multitask Audio Editing Benchmark"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":15,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2606.07229."}