Pith. sign in

Paper Citation Record · LEDGER

MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2505.13032.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.13032 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 40 of 40 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 40 of 40 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T19:02:41.013510Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation c0ea1ff9-b90e-4dea-b21d-9771092d2392 · inbound

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks cites this paper.

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-05-19T02:41:59.617089Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-05-19T02:41:52.996457Z digest=sha256:8156e1196a41d4c968aacb7817047ab420f16925d18969adbc6e47969bcfab96

Observation 152eed71-91e6-42da-9dec-b4226d8ff683 · inbound

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models cites this paper.

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-18T11:11:17.876150Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-18T11:08:08.916893Z digest=sha256:e70ca920c200905ad571040854c1ca6beaf2c88aa31a726f3da1ee921169b828

Observation aa23bad6-c2cb-4114-9261-b27d6cec8f14 · inbound

Robustness assessment of large audio language models in multiple-choice evaluation cites this paper.

Robustness assessment of large audio language models in multiple-choice evaluation MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T11:30:24.529386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T11:30:24.529386Z digest=sha256:9f3820996011f31a7ced7a456e70515898083b94d6a21ca4765353ad625b07b5

Observation f721397d-e7b9-4569-98c5-5247d43af320 · inbound

AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning cites this paper.

AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T11:23:19.304868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T11:23:19.304868Z digest=sha256:6ebb9b34fb895b4c10735f27549019691d43533c0bf9a092fd22e41168ea3466

Observation 79175ecb-6a78-446b-aaad-b157ba509d01 · inbound

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents cites this paper.

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T10:13:42.663241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T10:13:42.663241Z digest=sha256:38ec2c1c4d18ac25f7c3f5ab55360efabf86126ed8e06eafada86a279cfb8cf0

Observation c171446b-c51c-4493-9a76-50842f872cfe · inbound

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation cites this paper.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.705003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.705003Z digest=sha256:4df38d3d03084b8ad5fb25b3c44a3d3d5d26fa3744d7f98bb11eb16378463bd4

Observation 0641492d-ef98-48b5-a9d1-1df261d82689 · inbound

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering cites this paper.

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-03T19:38:24.214906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T19:38:24.214906Z digest=sha256:ca9555e8ea6e842d2b8124b4af42a803dc0c6524bd841935f0d0e25fc8a89e2e

Observation 474c89ad-ff40-4a63-afa2-9db29c20e7f5 · inbound

Omni2Sound: Towards Unified Video-Text-to-Audio Generation cites this paper.

Omni2Sound: Towards Unified Video-Text-to-Audio Generation MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-16T17:28:10.049255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-16T17:25:38.591071Z digest=sha256:e4951e8312c88a5132b8c5e4ee2cb68e43143bc8fece18f80bdd1d72628e65fb

Observation 6ac55984-e2be-4519-9b7a-c4ef584c94d0 · inbound

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering cites this paper.

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-16T14:07:58.685833Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-16T14:04:17.935630Z digest=sha256:fe80d48632f7c13aa744f1fbddf42cba5b712f4d028ca22c6a3375f1e734347c

Observation 8471acb8-d7c3-46b0-a26b-e8b30fd7cbc5 · inbound

OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization cites this paper.

OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 75

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:10:43.140348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-16T07:09:46.254851Z digest=sha256:67325160a679f6d13efbd58a899f9421a3654f01a14232ec3b9b11cc8a9fbe72

Observation 5c781189-f558-491a-a1d5-8b5e42eafa9b · inbound

OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering cites this paper.

OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 21

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T06:11:01.948269Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T17:45:51.528645Z digest=sha256:5e8a2d4e973a82b208da467910fc905c17fefb931b34ea5058298191d7470716

Observation 78be80f0-2027-42b8-a2c5-09f9b1782fdd · inbound

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models cites this paper.

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-10T14:10:28.324307Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T14:10:03.707886Z digest=sha256:173127d103e8cd60a47b9b21b0fd7a1ecb5efd0146a7cd35743df6ce3cb9abb6

Observation bd1e90bb-740a-4a33-983b-3a7427757246 · inbound

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models cites this paper.

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-12T21:18:46.566338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T21:18:46.566338Z digest=sha256:f8a5d615d7d4f589e16cd2f5da8175a0928e2d0b23a7d60002e88a7e08e717f5

Observation 14ffd3cf-7f30-4117-b8fc-8452e52c17f8 · inbound

Qwen3.5-Omni Technical Report cites this paper.

Qwen3.5-Omni Technical Report MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-10T08:12:25.528544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T08:11:22.402552Z digest=sha256:5f995db6d596c6208989e5e9201babf353b09be2addf02e49374ba11f454b13c

Observation d36301f1-b210-4179-b7d9-79d79e33735f · inbound

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models cites this paper.

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-12T00:41:26.472451Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-07T14:29:18.348031Z digest=sha256:551e71a9ba2810465aeb44ac0824b8b957a452c6571fb8d1e64c447a52a46458

Observation 4a92f963-fa4a-4ffd-bede-1c716414a507 · inbound

Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models cites this paper.

Task-Aware Answer Preservation under Audio Compression for Large Audio Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-11T22:01:11.809837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-08T03:37:54.477279Z digest=sha256:6f5f32798e954b697328ac2a7d9b802ab2b01879953410a2273b77ee585d40df

Observation cc39da04-14be-4fa5-b2a3-352957fc7b32 · inbound

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model cites this paper.

Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-13T04:07:13.497793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T04:03:27.608638Z digest=sha256:b55fdf2e284512f0d3a34166b7e0b6926591ae1af3f017371a995ec40a11cb52

Observation 91a4b310-96d0-4f1a-88dd-ba250d6a20d8 · inbound

ViMU: Benchmarking Video Metaphorical Understanding cites this paper.

ViMU: Benchmarking Video Metaphorical Understanding MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-15T04:55:04.098583Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-15T04:51:28.288476Z digest=sha256:08120395450611864fe2273e52b3f6953770f99428393d5b03c4cab9f7ed703e

Observation dff1ec23-b6eb-4dae-99cf-683e73bdfa0e · inbound

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook cites this paper.

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 184

Resolution
verified exact
arxiv_id, observed 2026-05-21T07:39:48.796691Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-21T07:38:23.099479Z digest=sha256:6fdb5e2cf138d151ccddc075e32c1c6dbb52c949e4d1aa9a14469d3fe4291744

Observation ed348d9c-01ba-4551-b5f0-89b367c0933b · inbound

A Survey of Audio Reasoning in Multimodal Foundation Models cites this paper.

A Survey of Audio Reasoning in Multimodal Foundation Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 121

Resolution
verified exact
arxiv_id, observed 2026-05-21T02:09:24.122241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-21T02:08:06.976461Z digest=sha256:7b1de03d170d9639be0390eab9286ff51934b24a68b8281b06b504e46b48f03f

Observation 3946f81a-ca8f-4bb7-9500-2be86240a790 · inbound

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs cites this paper.

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-07-01T13:45:45.525920Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-30T22:52:43.396119Z digest=sha256:b9f517c2da6f9b339ecaec3bfef998004a78eb8f59c6d39b40e42058f90bc3cf

Observation 106a13cf-e029-45a9-8dbc-0b8c15f6618b · inbound

Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization cites this paper.

Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-06-29T17:53:47.543232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-29T17:45:10.339950Z digest=sha256:38773b71e261e2288da8369053a8b035186a530efc66339c82a23264148fa452

Observation f915d858-d9f7-49f3-9296-81babc305094 · inbound

Audio-Mind: An Auditable Agentic Framework for Audio Understanding cites this paper.

Audio-Mind: An Auditable Agentic Framework for Audio Understanding MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-06-29T10:13:17.578490Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-29T10:03:54.653164Z digest=sha256:0657689052153424a84040e87a8a4729980c09817fd8ac6e8c1bf16e82bf6c75

Observation 69d7a8f7-47e5-4d33-b6c2-5d1e157bf6b8 · inbound

A Unified and Reproducible Experimentation Framework for Speech Understanding cites this paper.

A Unified and Reproducible Experimentation Framework for Speech Understanding MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-07-01T20:16:12.221545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-28T21:20:16.428207Z digest=sha256:1153a00c7eea42b2d66da74307770b47301feb751a90a04bbfec3518a73dcf80

Observation 09b4c3d6-a41a-4c77-866a-a0fc1bb40cae · inbound

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects cites this paper.

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 53

Resolution
verified exact
arxiv_id, observed 2026-06-28T17:52:27.046974Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-28T17:44:07.669223Z digest=sha256:ccc84c9ca86d7bac38033800877045aea86f707f2b0353abc2cdecde7e8f5b6e

Observation c1785c1d-8c56-4343-a04d-f990d3fcfe49 · inbound

MOSS-Audio Technical Report cites this paper.

MOSS-Audio Technical Report MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-07-02T00:56:25.042011Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-28T13:05:29.813707Z digest=sha256:444e0d09c7d3c845434e37cfb003c122a1ed83f1b9d6ee1c40324cefabdc59ae

Observation 332d5daa-7dc9-4bb5-82d2-4df03117a0d1 · inbound

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track cites this paper.

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-07-02T20:07:21.343611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:02:19.300441Z digest=sha256:a2c18df854dd2bbaf5e5b39b97797567b4db1e1b85a26e61ceb06aef0b28d914

Observation 999708c9-b3b1-45c6-9cc8-a69c06fd7859 · inbound

TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints cites this paper.

TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-07-02T23:17:29.792398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T18:18:41.816342Z digest=sha256:357f8e296bbc4c2a71497c6d47fef3c65f99512f52ab984ebb9301ccb4810637

Observation ecd17084-6b4e-461d-8879-8a95dce18a54 · inbound

RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark cites this paper.

RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:17:43.948271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T12:11:56.629002Z digest=sha256:fa709672b377fa8f650ef176018565bfbc3dc17fc9c16fa08640cf218cd33514

Observation d864592e-ca3e-4336-b532-a45832ade299 · inbound

A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models cites this paper.

A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-07-03T22:39:01.636822Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T23:25:46.349380Z digest=sha256:2aa3adea0940d8b074ca316c0b2cd99700994d507630ea7cba02903ec82acdda

Observation 1d713cd4-f323-4f0e-af45-1d2104b5379d · inbound

Continuous Audio Thinking for Large Audio Language Models cites this paper.

Continuous Audio Thinking for Large Audio Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:47:17.982073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-27T21:52:49.839901Z digest=sha256:d553dfa6c2e157f9da2b51c511c544d5361473fda464446243baab205ad6373a

Observation 5623885a-4d30-45b6-94ec-e4999e929b02 · inbound

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models cites this paper.

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 26

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T20:10:07.956816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-06-25T20:36:24.901454Z digest=sha256:88a8cc889b1553354c079b3ac82458fd67b7e3a60e6cff26e13e1a6f1e781f02

Observation 4c716412-4af6-47e6-85a1-ce211034605b · inbound

Unified Audio Intelligence Without Regressing on Text Intelligence cites this paper.

Unified Audio Intelligence Without Regressing on Text Intelligence MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 48

Resolution
metadata mismatch
local_arxiv, observed 2026-07-08T00:04:22.548282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-07-07T23:59:38.702609Z digest=sha256:105f1b773e58456f327ddafebfee700f2c2eda66fb5f8894738bc02670229b3e

Observation 7a251b6c-e59c-4191-87b0-26578b22e099 · inbound

Unified Audio Intelligence Without Regressing on Text Intelligence cites this paper.

Unified Audio Intelligence Without Regressing on Text Intelligence MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 48

Resolution
unresolved
no resolver link, observed 2026-07-11T07:46:49.059192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-11T07:46:49.059192Z digest=sha256:697ae043d28ca0333a8a5ad652007c876a11f7d8a4e39599857f804c6fcf2e50

Observation 7186ecf6-6145-494f-9dab-65ba9f74b0a5 · inbound

Empowering Long-form Omni-modal Understanding with Robust Audio Perception cites this paper.

Empowering Long-form Omni-modal Understanding with Robust Audio Perception MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 34

Resolution
unresolved
no resolver link, observed 2026-07-14T12:48:58.688011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T12:48:58.688011Z digest=sha256:e526d478ca26d6c5442e55ce9eab36a9b86885e5aa20de10b54e2adf0dd42950

Observation 845f6050-4f64-412b-ab73-8ac9afaa3b9a · inbound

Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models cites this paper.

Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-02T05:20:02.704210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T05:20:02.704210Z digest=sha256:3025599fae6648f315cc5007aac9e99ed960b4c2c30797102e568f2f132087c8

Observation ee5013f1-6efc-402a-b10f-21f3f7de974c · inbound

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering cites this paper.

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-01T14:37:31.517268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T14:37:31.517268Z digest=sha256:adf8192b0b128d4bb67e221c8218df2484ee2363760e1cf01cb5d84d87c63cbd

Observation 79395fd8-cb8f-4eb4-a852-a748d76f965b · inbound

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment cites this paper.

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 212

Resolution
unresolved
no resolver link, observed 2026-08-01T07:12:17.865288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T07:12:17.865288Z digest=sha256:78f90f6b7d799b125ca8006ae0eaf8275e283ce1ad2974d1e156c839d6601ab4

Observation 3e2e166e-f451-4bf5-9455-58dc409ab545 · inbound

Weak-to-Strong On-Policy Distillation cites this paper.

Weak-to-Strong On-Policy Distillation MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 143

Resolution
unresolved
no resolver link, observed 2026-08-01T00:26:31.831014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T00:26:31.831014Z digest=sha256:aceb711d233f448b6673ac39fb27bc4d5a21758cedf9585040d2ab28a401dbab

Observation 2e2a3dbc-9498-453c-a23b-34a3e2ccf11a · inbound

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models cites this paper.

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T19:02:41.013510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T19:02:41.013510Z digest=sha256:f7e397e669b35d28d4de87773c83775301bd0e340cb1fa15ded797d15a0d73cb