{"as_of":"2026-08-08T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dfbb2bcf403c394025d6da553f0dc6da05dc1b3f7fe96b308703d2910dbe56e7","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:05:16.177062Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:05:12.925006Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T14:17:03.115400Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-08-07T15:05:12.925006Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.925006Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:dc8950d8c6bfeccd9f27a88b9b7277f1b82b143ea9d4beef12fe283d65c841c9","observation_id":"2f11c02f-2ad4-4b77-9ca6-58eae6c42276","resolution":{"observed_at":"2026-08-07T15:05:12.925006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":"2505.16369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-07-02T14:17:03.115400Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric Xing, et al","venue":null,"work_id":"03e78c36-e3f4-4a63-bae1-e03871402bcf","year":2025},"citing_paper":{"arxiv_id":"2509.08031","last_updated":"2026-05-11T14:29:23Z","snapshot_observed_at":"2026-08-05T09:03:01.095551Z","submitted_at":"2025-09-09T15:30:40Z","title":"AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:01.257126Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2509.08031"},"observation_digest":"sha256:330d646334d5700221400018ad87ac70bc869702dbd20b9ab1801306de344703","observation_id":"054cc496-1d59-4e3e-8e16-1c7faa9956a9","resolution":{"observed_at":"2026-05-18T18:11:43.145790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":"2505.16369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-07-02T14:17:03.115400Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric Xing, et al","venue":null,"work_id":"03e78c36-e3f4-4a63-bae1-e03871402bcf","year":2025},"citing_paper":{"arxiv_id":"2606.05544","last_updated":"2026-07-16T00:44:34Z","snapshot_observed_at":"2026-08-02T19:37:00.359300Z","submitted_at":"2026-06-04T00:58:16Z","title":"Probing Spatial Structure in Pretrained Audio Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T00:34:43.472094Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2606.05544"},"observation_digest":"sha256:494fa391a8cd0d7d3794c59e4b1c5b18f6edc74b5ba74431f6ebf67f28772f81","observation_id":"50834e18-e74a-4b31-a36e-a43cb59cea13","resolution":{"observed_at":"2026-07-02T14:17:03.116783Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-08-02T12:23:45.341806Z","title":"X-ares: A comprehensive framework for assessing audio encoder performance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05544","last_updated":"2026-07-16T00:44:34Z","snapshot_observed_at":"2026-08-02T19:37:00.359300Z","submitted_at":"2026-06-04T00:58:16Z","title":"Probing Spatial Structure in Pretrained Audio Representations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T12:23:45.341806Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2606.05544"},"observation_digest":"sha256:abdcf0de30b970b2a29efb308fdab230a276da29bb80515c730ff82dc0d1049f","observation_id":"ed45fb58-73c8-4f9a-baa7-ded281058537","resolution":{"observed_at":"2026-08-02T12:23:45.341806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16369/citation-record","integrity":"/paper/2505.16369/integrity","json":"/paper/2505.16369/citation-record.json","paper":"/paper/2505.16369"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:22.453061Z","title":null,"venue":null,"work_id":"0f650921-5898-4a5b-ae57-b64c4ed6e86e","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.633476Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:d1ffda43f6c2ed7492695b7f44a2c51f4e433ebfbcfca04193ccc8db93b34593","observation_id":"5c036217-80f1-4122-bc8b-f229c44341d8","resolution":{"observed_at":"2026-08-07T15:05:22.508548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:22.324165Z","title":null,"venue":null,"work_id":"6483cced-4c14-4a55-8bcb-8aa70cf43ed6","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.686723Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:0d146784e795fe605283cc5e015702be47233ed2632981f4ba79d48babf51055","observation_id":"dbca00b5-4be5-4ff5-8913-45f65a97eef7","resolution":{"observed_at":"2026-08-07T15:05:22.385652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:22.248923Z","title":null,"venue":null,"work_id":"1fb87342-11f9-4d3c-a69e-4988f92410b1","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.760031Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:ce69f9e6ff5fb672b123527813fc23baaca41562a79e07949ebbe1fd9355ce35","observation_id":"c4a2c8fe-1142-42e7-879a-c8299e39c340","resolution":{"observed_at":"2026-08-07T15:05:22.274533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:22.148551Z","title":null,"venue":null,"work_id":"06c92da8-92ce-4862-9db8-54aeecadd101","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.846604Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:21e8ed0b4da309120397d4028202ea7b1637e7af7b19da912eb0c8aa30631df9","observation_id":"b1232899-2511-4dea-b526-3db91cf0a0a5","resolution":{"observed_at":"2026-08-07T15:05:22.183876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.988083Z","title":null,"venue":null,"work_id":"ad99a161-4480-4897-8bb1-84f00647554d","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.882556Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:f702fa8db6d9059159fe5c346c3450180e3f7d72a848ca2d05d52edd68532b52","observation_id":"704ada23-c0ac-4b4b-86a8-cd5792e6c03c","resolution":{"observed_at":"2026-08-07T15:05:22.060727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16369","snapshot_observed_at":"2026-08-07T15:05:12.925006Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.925006Z"},"links":{"cited_paper":"/paper/2505.16369","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:dc8950d8c6bfeccd9f27a88b9b7277f1b82b143ea9d4beef12fe283d65c841c9","observation_id":"2f11c02f-2ad4-4b77-9ca6-58eae6c42276","resolution":{"observed_at":"2026-08-07T15:05:12.925006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.742706Z","title":null,"venue":null,"work_id":"dc4f7c2a-8405-4185-b18f-9d8c82826078","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:12.997487Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:4c24f5f46174d702f62f61f1577788a77d61df1062c7f533c4f302d7fa7908e0","observation_id":"993755cc-6b45-4341-9d80-3e9e0a935380","resolution":{"observed_at":"2026-08-07T15:05:21.858774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.548834Z","title":"Speech tasks in X-ARES assess both linguistic content (e.g., speech content, word spotting) and paralinguistic features (e.g., emotion, speaker identity, accent)","venue":null,"work_id":"15d7ddb4-104f-4194-b9a2-0b527aebe943","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.082562Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:600d43f070279819e3718c4fc5eba6b8de061eb5b57bea002fbc01192462669c","observation_id":"dc18be9a-6119-47be-887e-83e6eed81894","resolution":{"observed_at":"2026-08-07T15:05:21.622695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.318218Z","title":"Task-Specific Metrics A summary of all metrics used in X-ARES is provided in Ta- ble 1","venue":null,"work_id":"b9f6a840-b158-40ea-8984-d476fffd95b2","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.139877Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:ec2777d342a1604abb5a479be9bf0c49965e4362f69bb5587b3623c572b18e9e","observation_id":"2dfd6b30-c20b-4582-962b-d9c6eec7a980","resolution":{"observed_at":"2026-08-07T15:05:21.406287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.157042Z","title":"First, speech encoders such as data2vec [3], HuBERT [35], wav2vec2- large [2], WavLM [36] and Whisper-base [37]","venue":null,"work_id":"13f57284-1e57-485d-89bc-d13ce123705a","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.192515Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:07402964f3e0a7d2ff803ac1b5b09beceef88a2e76c71d23465e98405436d3e8","observation_id":"4e4da20e-5f83-48ab-8ee3-207cda013197","resolution":{"observed_at":"2026-08-07T15:05:21.207688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.026467Z","title":null,"venue":null,"work_id":"53028f36-9b27-4303-8994-85448d1a6314","year":null},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.266033Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:f65d4ec2f44a2140040af37eb350c31fa8708062e11bce950ef4bb6bfe7d03e5","observation_id":"19e6f7d6-df6b-4ca8-86f1-4b048b78bcca","resolution":{"observed_at":"2026-08-07T15:05:21.070057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.903637Z","title":"Scal- ing up masked audio encoder learning for general audio classifica- tion,","venue":null,"work_id":"7bb81c16-06a2-43bb-825f-21a9bd2baf9f","year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.321211Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:babac0366c596571d6f43fa5be174727c45dc98e6c59e2df5e627b90cfb9c9ae","observation_id":"1527872a-4813-475c-ae7b-70f75ee2c235","resolution":{"observed_at":"2026-08-07T15:05:20.948278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:13.409608Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.409608Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:2851556bba2478515ede62ca2e504e1bf29d614c6fd609c53352e510275fe303","observation_id":"06656f89-cb63-4e21-a1d1-0c6d306a15f6","resolution":{"observed_at":"2026-08-07T15:05:13.409608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:13.477073Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.477073Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:e7e923633b5d7a5283eb92dec33e1675ee7718c216fb0b1a002e665762a2e84a","observation_id":"f1ed79dd-3a94-4892-9e2d-c850a7aee805","resolution":{"observed_at":"2026-08-07T15:05:13.477073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T15:05:13.546494Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.546494Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:168568f8a18a05f3775161f322798d36b441ce143d1a71feb8cbd12d5df668e4","observation_id":"439a7da9-d5ea-410b-b0ae-9e61248b5594","resolution":{"observed_at":"2026-08-07T15:05:13.546494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.784235Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"36141bc2-b954-48d9-9526-0d8ceb6960d4","year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.634240Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:9b4ce51970eda97e631a770585f4416c64bed6141dabf170451c78b59e17f982","observation_id":"2ac3bb46-8cea-453b-a5b0-f256e9e01d9a","resolution":{"observed_at":"2026-08-07T15:05:20.842042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08742","last_updated":"2024-11-13T16:20:20Z","snapshot_observed_at":"2026-08-05T16:56:14.293357Z","submitted_at":"2024-11-13T16:20:20Z","title":"A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08742","snapshot_observed_at":"2026-08-07T15:05:13.708782Z","title":"A comparative study of discrete speech tokens for semantic-related tasks with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.708782Z"},"links":{"cited_paper":"/paper/2411.08742","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:e03aba31458f4e6c5868426e97881618729deec2d73a91c7ef31e5144b94976c","observation_id":"f5f248cf-2e0c-4431-ace5-6751d1a27ea2","resolution":{"observed_at":"2026-08-07T15:05:13.708782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.531519Z","title":"HEAR: Holistic evaluation of audio representations,","venue":null,"work_id":"728edb43-53a6-4f3f-a6c5-a7f604f99fa1","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.750037Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:83371a338c35e1636aadb866edec7d17c09cd40e5706d57ae1c48b78f065cd54","observation_id":"2e52c619-c6af-46ad-b5c9-5343f2bac86d","resolution":{"observed_at":"2026-08-07T15:05:20.642237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.385000Z","title":"SUPERB: Speech processing universal performance benchmark,","venue":null,"work_id":"a81698e2-e7b7-4093-a96f-202deecfde3a","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.786047Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:69ffde5c59a18d1a695381159772c8def7a8d71b8e4f716044064921ea21baab","observation_id":"c729de9a-d587-4aad-9f1a-e3fed0156598","resolution":{"observed_at":"2026-08-07T15:05:20.446806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-07T15:05:13.887958Z","title":"DASB–discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.887958Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:851a18bd13f65e58ac40d8992470bc746cbf9d91f1e8cf0d003c4f0da776f015","observation_id":"dcec1deb-46c5-4495-bcb4-7b79390f6993","resolution":{"observed_at":"2026-08-07T15:05:13.887958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:20.138048Z","title":"Webdataset: A library for efficient loading of large-scale datasets,","venue":null,"work_id":"e703213a-49b7-4ca2-899d-090e5136ace6","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.947177Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:dd80c1d365984e76eea7b699c45e63a0ab35c06054d0cb65af100021598b739d","observation_id":"c9c21023-6c9d-4848-b8e6-0289d70ae5fa","resolution":{"observed_at":"2026-08-07T15:05:20.262234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-07-06T19:57:51.125083Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-08-07T15:05:13.993912Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understanding and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:13.993912Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:10f3cf490f665343eb6e67004985a4d84a7dbdd724a243740cd9b6b815ba04e0","observation_id":"73c8ef13-d7cc-4755-9169-6b8a683ff4b4","resolution":{"observed_at":"2026-08-07T15:05:13.993912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:19.911434Z","title":"Auto- matic speaker verification spoofing and countermeasures challenge (asvspoof 2015) database,","venue":null,"work_id":"1d988fc1-a8a0-4942-ad80-2e473cfddf68","year":2015},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.053402Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:431dd8cf2cfaa1fb1ab9481765b00cf05d461a1d4fb45aacb38be372c8c1a36b","observation_id":"771974a9-2a03-491a-86a7-4004fae0a578","resolution":{"observed_at":"2026-08-07T15:05:19.995656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:19.570425Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":"41eff5bb-a3cd-4630-8246-fbc903a0ba89","year":2014},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.145115Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:1eb5f6f34d162eb24e2d820c36c2e753751a6a4968bf3af6b9d5eeb0a1d2d5e4","observation_id":"a866a237-3e77-4dbc-898b-87660ba7ee8c","resolution":{"observed_at":"2026-08-07T15:05:19.743695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03670","last_updated":"2019-07-25T17:56:23Z","snapshot_observed_at":"2026-07-06T07:44:28.011439Z","submitted_at":"2019-04-07T15:24:32Z","title":"Speech Model Pre-training for End-to-End Spoken Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03670","snapshot_observed_at":"2026-08-07T15:05:14.197126Z","title":"Speech model pre-training for end-to-end spoken language under- standing,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.197126Z"},"links":{"cited_paper":"/paper/1904.03670","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:e50f615931823ad87cde385d81a9763258d7d071f53f83a63a2b4cce4e4febca","observation_id":"d5e70fa5-877b-462d-8c31-0932f4dfd7eb","resolution":{"observed_at":"2026-08-07T15:05:14.197126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:19.297084Z","title":"Libricount, a dataset for speaker count estimation,","venue":null,"work_id":"c1cc5428-4f9f-4e98-b8c6-890fe49b95e4","year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.245520Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:ace26ba7c84f31ff5b584c687ea55919fcf5549d1dc845a3038c160c1df9f093","observation_id":"14ffa220-145d-49d7-b987-8b9d6fc74cfa","resolution":{"observed_at":"2026-08-07T15:05:19.411970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:19.107386Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"861a8da0-7fc8-4af2-b675-8fd73bd27f9c","year":2015},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.314108Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:0036290bc0bf895efd3f390cbb9d1da03ca634f3a2cc1af3107454990c246904","observation_id":"9a8b808b-fa75-4ebb-b7db-3ae814e7ac6e","resolution":{"observed_at":"2026-08-07T15:05:19.185013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.858069Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, mul- timodal set of facial and vocal expressions in north american en- glish,","venue":null,"work_id":"43c4729a-0b98-4103-860f-f51f633a629e","year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.351157Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:b3e0a778437299effab8a3210316468456c20bf355a46d9938554fe970483d7e","observation_id":"965c1ea6-0086-4115-af28-0b07ec0223a9","resolution":{"observed_at":"2026-08-07T15:05:18.938845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.730081Z","title":"V ocalsound: A dataset for improving human vocal sounds recognition,","venue":null,"work_id":"bf9d71d2-831e-4a74-9251-221c81a80fa5","year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.413893Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:958a43f678a7e83d4ddc6bb097bae04c84baec60fe8187092497b1b0cccf3bbc","observation_id":"fa3a3cd7-6b1c-4d24-acea-f2532c1d4aaa","resolution":{"observed_at":"2026-08-07T15:05:18.775240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-07T15:05:14.453341Z","title":"Speech commands: A dataset for limited-vocabulary speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.453341Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:58c021c7f00c28ed2837d16f987622601d755bd078d8ded9631d4e33c279f3b5","observation_id":"de60e614-7968-4087-ac1d-bcad00f2d2b5","resolution":{"observed_at":"2026-08-07T15:05:14.453341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.578462Z","title":"V oxceleb: Large-scale speaker verification in the wild,","venue":null,"work_id":"3ccf637c-23de-476c-91a9-410e33e8a9d0","year":2020},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.500431Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:393badf552f51dc42d2c15fcd2b4c72a8fd3b1adbe363eeb6536e87f1b4d5eea","observation_id":"aed14a54-584f-4ce3-936f-e8b78d8d23da","resolution":{"observed_at":"2026-08-07T15:05:18.633665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.429538Z","title":"V oxlingua107: a dataset for spoken lan- guage recognition,","venue":null,"work_id":"5e0ff778-e936-4046-a7d9-4ddd94612451","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.602751Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:12ca690a118ec0d00eb71a975170dba19b9c8b62562ac81f278290db3eca2e58","observation_id":"9a978da9-62e7-4c3f-aadd-e26ad02fa055","resolution":{"observed_at":"2026-08-07T15:05:18.497605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.266962Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":"4352c69b-76c1-4aa9-a2e2-581728445ed3","year":2020},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.683701Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:eb6186940c518c3b810ed83e478ffef84f1363a3d534d33319e7fcb5e1f686f1","observation_id":"9c1653dc-7cf2-4660-8f5b-24600d37b9a4","resolution":{"observed_at":"2026-08-07T15:05:18.346780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:14.729698Z","title":"Sound event detection in domestic environments with weakly labeled data and soundscape synthesis,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.729698Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:cb8366ba04f6027f79b4725c7268a27b98061eab2c1863b401a32083d106f6b7","observation_id":"5aa12670-3ac5-4565-b519-cc23cd978ad0","resolution":{"observed_at":"2026-08-07T15:05:14.729698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.167322Z","title":"Esc: Dataset for environmental sound classification,","venue":null,"work_id":"87f1e35f-ade6-4535-bdcc-8b6dc6926c86","year":2015},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.791640Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:1d483835e6370cf72d3ff2ef13c4848f7e735643a7d67a858d5d1567a8186da2","observation_id":"f338b51a-d029-47c9-b170-a18b304474ff","resolution":{"observed_at":"2026-08-07T15:05:18.209463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09902","last_updated":"2018-10-07T02:25:28Z","snapshot_observed_at":"2026-07-06T06:52:21.185384Z","submitted_at":"2018-07-26T00:30:54Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.09902","snapshot_observed_at":"2026-08-07T15:05:14.851891Z","title":"General-purpose tagging of freesound audio with audioset labels: Task description, dataset, and baseline,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.851891Z"},"links":{"cited_paper":"/paper/1807.09902","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:1ab730885da71794f70a5c75f6633199101b4bdd101d17fab41f3bcdb04fc289","observation_id":"634f069f-c613-4450-af48-f650ef6c26d0","resolution":{"observed_at":"2026-08-07T15:05:14.851891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.037391Z","title":"Fsd50k: an open dataset of human-labeled sound events,","venue":null,"work_id":"c48e9ec9-a2ee-4029-8f9c-cf832198c389","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:14.894548Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:9eeccc08e85222a8328947c30b7868ed74f2ac0df09952a537092979e1120dae","observation_id":"81afb060-0127-4091-84d4-bcf206baac7b","resolution":{"observed_at":"2026-08-07T15:05:18.105386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.912691Z","title":"A dataset and taxonomy for urban sound research,","venue":null,"work_id":"5761ba0f-9abe-4c6f-8a3b-0b1a315bce83","year":2014},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.015691Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:1e3a603eb4a498168c03e49afd4b85c78e81c07f9165d5cda8d3969fd3199b83","observation_id":"4f14be62-c8e4-40b2-a172-651dbe937d78","resolution":{"observed_at":"2026-08-07T15:05:17.967320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.781039Z","title":"V ocal imitation set: a dataset of vocally imitated sound events using the audioset ontol- ogy","venue":null,"work_id":"d07f5aec-c10f-4966-a9e5-20ee426e3bc8","year":2018},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.076689Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:513ddd135e041e31e50a14c42cfd32426009d8cdba6ea9901c53d624df94cc49","observation_id":"68e2ddd3-4fc4-4647-8672-3c4caa763074","resolution":{"observed_at":"2026-08-07T15:05:17.835492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-07-06T05:21:33.309016Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-07T15:05:15.124215Z","title":"Fma: A dataset for music analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.124215Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:00c953e6dadb05b699d165a0cd19bde4ddd46d927446bf46047aae7bf0a054af","observation_id":"ed313b6f-be7c-49e9-9de2-3c4aff4b2c79","resolution":{"observed_at":"2026-08-07T15:05:15.124215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.1461","last_updated":"2013-06-07T16:57:39Z","snapshot_observed_at":"2026-07-06T03:15:15.663270Z","submitted_at":"2013-06-06T16:30:44Z","title":"The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.1461","snapshot_observed_at":"2026-08-07T15:05:15.172725Z","title":"The gtzan dataset: Its contents, its faults, their effects on evaluation, and its future use,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.172725Z"},"links":{"cited_paper":"/paper/1306.1461","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:de3ed5e171135e61e326b2ab019cbdcd75d6d858ce887bfb724123cb4642d614","observation_id":"4cab7c97-93df-4044-a300-c21eb5f64746","resolution":{"observed_at":"2026-08-07T15:05:15.172725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.651821Z","title":"Enabling factorized piano music modeling and generation with the MAESTRO dataset,","venue":null,"work_id":"6fa66406-fd7b-420c-8c9e-d31677f5099f","year":2019},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.268363Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:1618de7c479e5348f191a4e7554b0185a01334e476fe243b506cfe8c06c63aab","observation_id":"08233fbb-8c66-45fb-9510-c75134e287b1","resolution":{"observed_at":"2026-08-07T15:05:17.698556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:15.328284Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.328284Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:3b42322cf929de57977e6078af6d63ae815143301c3e1440a691cd67d09edb37","observation_id":"92b1ddae-ce78-4abb-be0c-85afeef3dcd3","resolution":{"observed_at":"2026-08-07T15:05:15.328284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08962","last_updated":"2019-09-25T22:55:20Z","snapshot_observed_at":"2026-08-01T21:55:51.630328Z","submitted_at":"2019-08-23T18:02:05Z","title":"Well-Read Students Learn Better: On the Importance of Pre-training Compact Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08962","snapshot_observed_at":"2026-08-07T15:05:15.374000Z","title":"Well-read stu- dents learn better: On the importance of pre-training compact mod- els,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.374000Z"},"links":{"cited_paper":"/paper/1908.08962","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:618b9ec73aa7cd6c6604ae046903a2caf7bd6550a6399fac000686027c584595","observation_id":"f79a4b8a-b26f-42a1-b1b4-ab7a545d4d09","resolution":{"observed_at":"2026-08-07T15:05:15.374000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:05:15.440207Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.440207Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:8280974e416dfcace1d79777ff290b1588742cb0bed8be764de09248a02bd7b4","observation_id":"3d4c6043-9121-43c0-bad2-bdb496a44859","resolution":{"observed_at":"2026-08-07T15:05:15.440207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.518490Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":"aae07e43-9ac6-47c3-9bc6-ba747c463742","year":2021},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.523038Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:cba7513da6415ff1e369ef8914aa425c57dde043e109458752b8067ef3d144ab","observation_id":"499d38d2-16dd-4216-a0c9-77f8f2d873a0","resolution":{"observed_at":"2026-08-07T15:05:17.574285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.365800Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"43b55aec-6921-4807-929c-70e3e2950871","year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.629508Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:edc81a6aa0bbb5276c480c2b2da29dd6826f6ba0046a4d222789645f6936f828","observation_id":"2369ea91-14c9-4942-917f-7a350be7f87a","resolution":{"observed_at":"2026-08-07T15:05:17.410927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:15.693579Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.693579Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:1f0c8266f7ab1273d8e468e2aa020c263f0766ab0efa5f1f179b6e5b852e8d35","observation_id":"38afb6aa-897c-41a8-8494-e6cc89f06562","resolution":{"observed_at":"2026-08-07T15:05:15.693579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:05:15.772955Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.772955Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:d253ad5c81656ead06e0059ef74903391166238bee700d07abde73029e6ba482","observation_id":"7beb06ff-c36e-4a0f-a60f-e687ac17af26","resolution":{"observed_at":"2026-08-07T15:05:15.772955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.213385Z","title":"Byol-s: Learning self-supervised speech representations by bootstrapping,","venue":null,"work_id":"b65e0010-cff4-401d-b395-4174ebb28fc1","year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.912386Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:a8ab90b1f552a695a73098429817bf1c792afe25c0dd52fe44fa07f2833b9d44","observation_id":"ba6b32bd-cf43-428a-b26f-4614cd7e9644","resolution":{"observed_at":"2026-08-07T15:05:17.268704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.018756Z","title":"Ced: Consis- tent ensemble distillation for audio tagging,","venue":null,"work_id":"94221435-9cb8-442b-9786-df3375e7b8fd","year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.978730Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:8fafeadbd1a2e7f218f0696c97dbdc798310def4ebda92a5ae862528da615152","observation_id":"d91046c1-1e72-4745-9417-b1265cd2227b","resolution":{"observed_at":"2026-08-07T15:05:17.114721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:16.844968Z","title":"Self-supervised audio teacher-student transformer for both clip-level and frame-level tasks,","venue":null,"work_id":"a504b455-fbc1-4a01-bfa4-e41f1bb9483c","year":2024},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.094160Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:849eb61f51ad124ab63af895d8730f1854eef5fd237b566cf27076320fe37e00","observation_id":"042f13fe-47ea-4425-8537-3c102c889efe","resolution":{"observed_at":"2026-08-07T15:05:16.908635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:16.669372Z","title":"Masked modeling duo: Learning representations by encouraging both networks to model the input,","venue":null,"work_id":"986eae23-8fbd-45e3-9baa-c16a4f2777b9","year":2023},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.177062Z"},"links":{"citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:11a3f06b2fbbdf9426b5d172234648d73c9c3862850e1c4afb204c124d82b947","observation_id":"4c617c87-c424-4433-88e4-a67a9575db48","resolution":{"observed_at":"2026-08-07T15:05:16.754608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T22:08:02.323514Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 4 inbound Pith citation observations for arXiv:2505.16369."}