Pith. sign in

Paper Citation Record · LEDGER

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2505.16369.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.16369 v2

Coverage vector

measured 53 of 53 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:05:16.177062Z

measured 57 of 57 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:05:12.925006Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T14:17:03.115400Z

Reference resolution

53 of 53 outbound references displayed

  • verified exact0
  • verified fuzzy28
  • unresolved25
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5c036217-80f1-4122-bc8b-f229c44341d8 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.508548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:12.633476Z digest=sha256:d1ffda43f6c2ed7492695b7f44a2c51f4e433ebfbcfca04193ccc8db93b34593

Observation dbca00b5-4be5-4ff5-8913-45f65a97eef7 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.385652Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:12.686723Z digest=sha256:0d146784e795fe605283cc5e015702be47233ed2632981f4ba79d48babf51055

Observation c4a2c8fe-1142-42e7-879a-c8299e39c340 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.274533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:12.760031Z digest=sha256:ce69f9e6ff5fb672b123527813fc23baaca41562a79e07949ebbe1fd9355ce35

Observation b1232899-2511-4dea-b526-3db91cf0a0a5 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.183876Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:12.846604Z digest=sha256:21e8ed0b4da309120397d4028202ea7b1637e7af7b19da912eb0c8aa30631df9

Observation 704ada23-c0ac-4b4b-86a8-cd5792e6c03c · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:22.060727Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:12.882556Z digest=sha256:f702fa8db6d9059159fe5c346c3450180e3f7d72a848ca2d05d52edd68532b52

Observation 2f11c02f-2ad4-4b77-9ca6-58eae6c42276 · outbound

This paper cites X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:12.925006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:12.925006Z digest=sha256:dc8950d8c6bfeccd9f27a88b9b7277f1b82b143ea9d4beef12fe283d65c841c9

Observation 993755cc-6b45-4341-9d80-3e9e0a935380 · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:21.858774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:12.997487Z digest=sha256:4c24f5f46174d702f62f61f1577788a77d61df1062c7f533c4f302d7fa7908e0

Observation dc18be9a-6119-47be-887e-83e6eed81894 · outbound

This paper cites Speech tasks in X-ARES assess both linguistic content (e.g., speech content, word spotting) and paralinguistic features (e.g., emotion, speaker identity, accent).

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Speech tasks in X-ARES assess both linguistic content (e.g., speech content, word spotting) and paralinguistic features (e.g., emotion, speaker identity, accent)

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.622695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:13.082562Z digest=sha256:600d43f070279819e3718c4fc5eba6b8de061eb5b57bea002fbc01192462669c

Observation 2dfd6b30-c20b-4582-962b-d9c6eec7a980 · outbound

This paper cites Task-Specific Metrics A summary of all metrics used in X-ARES is provided in Ta- ble 1.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Task-Specific Metrics A summary of all metrics used in X-ARES is provided in Ta- ble 1

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.406287Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:13.139877Z digest=sha256:ec2777d342a1604abb5a479be9bf0c49965e4362f69bb5587b3623c572b18e9e

Observation 4e4da20e-5f83-48ab-8ee3-207cda013197 · outbound

This paper cites First, speech encoders such as data2vec [3], HuBERT [35], wav2vec2- large [2], WavLM [36] and Whisper-base [37].

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance First, speech encoders such as data2vec [3], HuBERT [35], wav2vec2- large [2], WavLM [36] and Whisper-base [37]

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.207688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:13.192515Z digest=sha256:07402964f3e0a7d2ff803ac1b5b09beceef88a2e76c71d23465e98405436d3e8

Observation 19e6f7d6-df6b-4ca8-86f1-4b048b78bcca · outbound

This paper cites an unresolved cited work.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-07T15:05:21.070057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:13.266033Z digest=sha256:f65d4ec2f44a2140040af37eb350c31fa8708062e11bce950ef4bb6bfe7d03e5

Observation 1527872a-4813-475c-ae7b-70f75ee2c235 · outbound

This paper cites Scal- ing up masked audio encoder learning for general audio classifica- tion,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Scal- ing up masked audio encoder learning for general audio classifica- tion,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.948278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:13.321211Z digest=sha256:babac0366c596571d6f43fa5be174727c45dc98e6c59e2df5e627b90cfb9c9ae

Observation 06656f89-cb63-4e21-a1d1-0c6d306a15f6 · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance wav2vec 2.0: A framework for self-supervised learning of speech representations,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.409608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.409608Z digest=sha256:2851556bba2478515ede62ca2e504e1bf29d614c6fd609c53352e510275fe303

Observation f1ed79dd-3a94-4892-9e2d-c850a7aee805 · outbound

This paper cites Data2vec: A general framework for self-supervised learning in speech, vision and language,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Data2vec: A general framework for self-supervised learning in speech, vision and language,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.477073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.477073Z digest=sha256:e7e923633b5d7a5283eb92dec33e1675ee7718c216fb0b1a002e665762a2e84a

Observation 439a7da9-d5ea-410b-b0ae-9e61248b5594 · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.546494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.546494Z digest=sha256:168568f8a18a05f3775161f322798d36b441ce143d1a71feb8cbd12d5df668e4

Observation 2ac3bb46-8cea-453b-a5b0-f256e9e01d9a · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Moshi: a speech-text foundation model for real-time dialogue,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.842042Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:13.634240Z digest=sha256:9b4ce51970eda97e631a770585f4416c64bed6141dabf170451c78b59e17f982

Observation f5f248cf-2e0c-4431-ace5-6751d1a27ea2 · outbound

This paper cites A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.708782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.708782Z digest=sha256:e03aba31458f4e6c5868426e97881618729deec2d73a91c7ef31e5144b94976c

Observation 2e52c619-c6af-46ad-b5c9-5343f2bac86d · outbound

This paper cites HEAR: Holistic evaluation of audio representations,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance HEAR: Holistic evaluation of audio representations,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.642237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:13.750037Z digest=sha256:83371a338c35e1636aadb866edec7d17c09cd40e5706d57ae1c48b78f065cd54

Observation c729de9a-d587-4aad-9f1a-e3fed0156598 · outbound

This paper cites SUPERB: Speech processing universal performance benchmark,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance SUPERB: Speech processing universal performance benchmark,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.446806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:13.786047Z digest=sha256:69ffde5c59a18d1a695381159772c8def7a8d71b8e4f716044064921ea21baab

Observation dcec1deb-46c5-4495-bcb4-7b79390f6993 · outbound

This paper cites DASB - Discrete Audio and Speech Benchmark.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance DASB - Discrete Audio and Speech Benchmark

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.887958Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.887958Z digest=sha256:851a18bd13f65e58ac40d8992470bc746cbf9d91f1e8cf0d003c4f0da776f015

Observation c9c21023-6c9d-4848-b8e6-0289d70ae5fa · outbound

This paper cites Webdataset: A library for efficient loading of large-scale datasets,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Webdataset: A library for efficient loading of large-scale datasets,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:20.262234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:13.947177Z digest=sha256:dd80c1d365984e76eea7b699c45e63a0ab35c06054d0cb65af100021598b739d

Observation 73c8ef13-d7cc-4755-9169-6b8a683ff4b4 · outbound

This paper cites SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:13.993912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:13.993912Z digest=sha256:10f3cf490f665343eb6e67004985a4d84a7dbdd724a243740cd9b6b815ba04e0

Observation 771974a9-2a03-491a-86a7-4004fae0a578 · outbound

This paper cites Auto- matic speaker verification spoofing and countermeasures challenge (asvspoof 2015) database,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Auto- matic speaker verification spoofing and countermeasures challenge (asvspoof 2015) database,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.995656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.053402Z digest=sha256:431dd8cf2cfaa1fb1ab9481765b00cf05d461a1d4fb45aacb38be372c8c1a36b

Observation a866a237-3e77-4dbc-898b-87660ba7ee8c · outbound

This paper cites Crema-d: Crowd-sourced emotional multimodal actors dataset,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Crema-d: Crowd-sourced emotional multimodal actors dataset,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.743695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.145115Z digest=sha256:1eb5f6f34d162eb24e2d820c36c2e753751a6a4968bf3af6b9d5eeb0a1d2d5e4

Observation d5e70fa5-877b-462d-8c31-0932f4dfd7eb · outbound

This paper cites Speech Model Pre-training for End-to-End Spoken Language Understanding.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Speech Model Pre-training for End-to-End Spoken Language Understanding

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.197126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.197126Z digest=sha256:e50f615931823ad87cde385d81a9763258d7d071f53f83a63a2b4cce4e4febca

Observation 14ffa220-145d-49d7-b987-8b9d6fc74cfa · outbound

This paper cites Libricount, a dataset for speaker count estimation,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Libricount, a dataset for speaker count estimation,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.411970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.245520Z digest=sha256:ace26ba7c84f31ff5b584c687ea55919fcf5549d1dc845a3038c160c1df9f093

Observation 9a8b808b-fa75-4ebb-b7db-3ae814e7ac6e · outbound

This paper cites Librispeech: an asr corpus based on public domain audio books,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Librispeech: an asr corpus based on public domain audio books,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:19.185013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.314108Z digest=sha256:0036290bc0bf895efd3f390cbb9d1da03ca634f3a2cc1af3107454990c246904

Observation 965c1ea6-0086-4115-af28-0b07ec0223a9 · outbound

This paper cites The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, mul- timodal set of facial and vocal expressions in north american en- glish,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, mul- timodal set of facial and vocal expressions in north american en- glish,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.938845Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.351157Z digest=sha256:b3e0a778437299effab8a3210316468456c20bf355a46d9938554fe970483d7e

Observation fa3a3cd7-6b1c-4d24-acea-f2532c1d4aaa · outbound

This paper cites V ocalsound: A dataset for improving human vocal sounds recognition,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V ocalsound: A dataset for improving human vocal sounds recognition,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.775240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.413893Z digest=sha256:958a43f678a7e83d4ddc6bb097bae04c84baec60fe8187092497b1b0cccf3bbc

Observation de60e614-7968-4087-ac1d-bcad00f2d2b5 · outbound

This paper cites Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.453341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.453341Z digest=sha256:58c021c7f00c28ed2837d16f987622601d755bd078d8ded9631d4e33c279f3b5

Observation aed14a54-584f-4ce3-936f-e8b78d8d23da · outbound

This paper cites V oxceleb: Large-scale speaker verification in the wild,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V oxceleb: Large-scale speaker verification in the wild,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.633665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.500431Z digest=sha256:393badf552f51dc42d2c15fcd2b4c72a8fd3b1adbe363eeb6536e87f1b4d5eea

Observation 9a978da9-62e7-4c3f-aadd-e26ad02fa055 · outbound

This paper cites V oxlingua107: a dataset for spoken lan- guage recognition,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V oxlingua107: a dataset for spoken lan- guage recognition,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.497605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.602751Z digest=sha256:12ca690a118ec0d00eb71a975170dba19b9c8b62562ac81f278290db3eca2e58

Observation 9c1653dc-7cf2-4660-8f5b-24600d37b9a4 · outbound

This paper cites Clotho: An audio cap- tioning dataset,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Clotho: An audio cap- tioning dataset,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.346780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.683701Z digest=sha256:eb6186940c518c3b810ed83e478ffef84f1363a3d534d33319e7fcb5e1f686f1

Observation 5aa12670-3ac5-4565-b519-cc23cd978ad0 · outbound

This paper cites Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.729698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.729698Z digest=sha256:cb8366ba04f6027f79b4725c7268a27b98061eab2c1863b401a32083d106f6b7

Observation f338b51a-d029-47c9-b170-a18b304474ff · outbound

This paper cites Esc: Dataset for environmental sound classification,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Esc: Dataset for environmental sound classification,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.209463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.791640Z digest=sha256:1d483835e6370cf72d3ff2ef13c4848f7e735643a7d67a858d5d1567a8186da2

Observation 634f069f-c613-4450-af48-f650ef6c26d0 · outbound

This paper cites General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:14.851891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:14.851891Z digest=sha256:1ab730885da71794f70a5c75f6633199101b4bdd101d17fab41f3bcdb04fc289

Observation 81afb060-0127-4091-84d4-bcf206baac7b · outbound

This paper cites Fsd50k: an open dataset of human-labeled sound events,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Fsd50k: an open dataset of human-labeled sound events,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:18.105386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:14.894548Z digest=sha256:9eeccc08e85222a8328947c30b7868ed74f2ac0df09952a537092979e1120dae

Observation 4f14be62-c8e4-40b2-a172-651dbe937d78 · outbound

This paper cites A dataset and taxonomy for urban sound research,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance A dataset and taxonomy for urban sound research,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.967320Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:15.015691Z digest=sha256:1e3a603eb4a498168c03e49afd4b85c78e81c07f9165d5cda8d3969fd3199b83

Observation 68e2ddd3-4fc4-4647-8672-3c4caa763074 · outbound

This paper cites V ocal imitation set: a dataset of vocally imitated sound events using the audioset ontol- ogy.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance V ocal imitation set: a dataset of vocally imitated sound events using the audioset ontol- ogy

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.835492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:15.076689Z digest=sha256:513ddd135e041e31e50a14c42cfd32426009d8cdba6ea9901c53d624df94cc49

Observation ed313b6f-be7c-49e9-9de2-3c4aff4b2c79 · outbound

This paper cites FMA: A Dataset For Music Analysis.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance FMA: A Dataset For Music Analysis

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.124215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.124215Z digest=sha256:00c953e6dadb05b699d165a0cd19bde4ddd46d927446bf46047aae7bf0a054af

Observation 4cab7c97-93df-4044-a300-c21eb5f64746 · outbound

This paper cites The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.172725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.172725Z digest=sha256:de3ed5e171135e61e326b2ab019cbdcd75d6d858ce887bfb724123cb4642d614

Observation 08233fbb-8c66-45fb-9510-c75134e287b1 · outbound

This paper cites Enabling factorized piano music modeling and generation with the MAESTRO dataset,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Enabling factorized piano music modeling and generation with the MAESTRO dataset,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.698556Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:15.268363Z digest=sha256:1618de7c479e5348f191a4e7554b0185a01334e476fe243b506cfe8c06c63aab

Observation 92b1ddae-ce78-4abb-be0c-85afeef3dcd3 · outbound

This paper cites Neural audio synthesis of musical notes with wavenet autoencoders,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Neural audio synthesis of musical notes with wavenet autoencoders,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.328284Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.328284Z digest=sha256:3b42322cf929de57977e6078af6d63ae815143301c3e1440a691cd67d09edb37

Observation f79a4b8a-b26f-42a1-b1b4-ab7a545d4d09 · outbound

This paper cites Well-Read Students Learn Better: On the Importance of Pre-training Compact Models.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Well-Read Students Learn Better: On the Importance of Pre-training Compact Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.374000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.374000Z digest=sha256:618b9ec73aa7cd6c6604ae046903a2caf7bd6550a6399fac000686027c584595

Observation 3d4c6043-9121-43c0-bad2-bdb496a44859 · outbound

This paper cites Qwen2.5 Technical Report.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Qwen2.5 Technical Report

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.440207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.440207Z digest=sha256:8280974e416dfcace1d79777ff290b1588742cb0bed8be764de09248a02bd7b4

Observation 499d38d2-16dd-4216-a0c9-77f8f2d873a0 · outbound

This paper cites Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.574285Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:15.523038Z digest=sha256:cba7513da6415ff1e369ef8914aa425c57dde043e109458752b8067ef3d144ab

Observation 2369ea91-14c9-4942-917f-7a350be7f87a · outbound

This paper cites Wavlm: Large-scale self-supervised pre-training for full stack speech processing,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Wavlm: Large-scale self-supervised pre-training for full stack speech processing,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.410927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:15.629508Z digest=sha256:edc81a6aa0bbb5276c480c2b2da29dd6826f6ba0046a4d222789645f6936f828

Observation 38afb6aa-897c-41a8-8494-e6cc89f06562 · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Robust speech recognition via large-scale weak supervision,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.693579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.693579Z digest=sha256:1f0c8266f7ab1273d8e468e2aa020c263f0766ab0efa5f1f179b6e5b852e8d35

Observation 7beb06ff-c36e-4a0f-a60f-e687ac17af26 · outbound

This paper cites BEATs: Audio Pre-Training with Acoustic Tokenizers.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance BEATs: Audio Pre-Training with Acoustic Tokenizers

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.772955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.772955Z digest=sha256:d253ad5c81656ead06e0059ef74903391166238bee700d07abde73029e6ba482

Observation ba6b32bd-cf43-428a-b26f-4614cd7e9644 · outbound

This paper cites Byol-s: Learning self-supervised speech representations by bootstrapping,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Byol-s: Learning self-supervised speech representations by bootstrapping,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.268704Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:15.912386Z digest=sha256:a8ab90b1f552a695a73098429817bf1c792afe25c0dd52fe44fa07f2833b9d44

Observation d91046c1-1e72-4745-9417-b1265cd2227b · outbound

This paper cites Ced: Consis- tent ensemble distillation for audio tagging,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Ced: Consis- tent ensemble distillation for audio tagging,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:17.114721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:15.978730Z digest=sha256:8fafeadbd1a2e7f218f0696c97dbdc798310def4ebda92a5ae862528da615152

Observation 042f13fe-47ea-4425-8537-3c102c889efe · outbound

This paper cites Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:16.908635Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:16.094160Z digest=sha256:849eb61f51ad124ab63af895d8730f1854eef5fd237b566cf27076320fe37e00

Observation 4c617c87-c424-4433-88e4-a67a9575db48 · outbound

This paper cites Masked modeling duo: Learning representations by encouraging both networks to model the input,.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance Masked modeling duo: Learning representations by encouraging both networks to model the input,

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:16.754608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:16.177062Z digest=sha256:11a3f06b2fbbdf9426b5d172234648d73c9c3862850e1c4afb204c124d82b947

Pith citing papers

Observation 2f11c02f-2ad4-4b77-9ca6-58eae6c42276 · inbound

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance cites this paper.

X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:12.925006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:12.925006Z digest=sha256:dc8950d8c6bfeccd9f27a88b9b7277f1b82b143ea9d4beef12fe283d65c841c9

Observation 054cc496-1d59-4e3e-8e16-1c7faa9956a9 · inbound

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs cites this paper.

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-18T18:11:43.145790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-18T18:07:01.257126Z digest=sha256:330d646334d5700221400018ad87ac70bc869702dbd20b9ab1801306de344703

Observation 50834e18-e74a-4b31-a36e-a43cb59cea13 · inbound

Probing Spatial Structure in Pretrained Audio Representations cites this paper.

Probing Spatial Structure in Pretrained Audio Representations X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 15

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T14:17:03.116783Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-28T00:34:43.472094Z digest=sha256:494fa391a8cd0d7d3794c59e4b1c5b18f6edc74b5ba74431f6ebf67f28772f81

Observation ed45fb58-73c8-4f9a-baa7-ded281058537 · inbound

Probing Spatial Structure in Pretrained Audio Representations cites this paper.

Probing Spatial Structure in Pretrained Audio Representations X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T12:23:45.341806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T12:23:45.341806Z digest=sha256:abdcf0de30b970b2a29efb308fdab230a276da29bb80515c730ff82dc0d1049f