{"as_of":"2026-08-12T14:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df6a2f53b6b0e2748714fc65f3f6b5936013eb9d010ebdc055879e3a3874f21e","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:27:09.170151Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:13:20.213020Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:13:20.931322Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"cited_work":{"arxiv_id":"2501.15302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15302","snapshot_observed_at":"2026-08-06T16:13:20.931322Z","title":"The ICME 2025 Audio Encoder Capability Challenge","venue":"cs.SD","work_id":"044573d7-fc54-4fbb-bd1d-f240d412dc32","year":2025},"citing_paper":{"arxiv_id":"2507.14129","last_updated":"2026-07-13T00:23:40Z","snapshot_observed_at":"2026-08-10T02:00:06.446809Z","submitted_at":"2025-07-18T17:57:46Z","title":"OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:13:20.213020Z"},"links":{"cited_paper":"/paper/2501.15302","citing_paper":"/paper/2507.14129"},"observation_digest":"sha256:16529f00aad1d6b596ebc1ce576e8431ae9f4ae0f6b0a4027aae63ce7c04a292","observation_id":"ee2596fe-f80a-466a-af9c-fdd960cdf5e5","resolution":{"observed_at":"2026-08-06T16:13:20.989094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15302/citation-record","integrity":"/paper/2501.15302/integrity","json":"/paper/2501.15302/citation-record.json","paper":"/paper/2501.15302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.722328Z","title":"Neural discrete representation learning,","venue":null,"work_id":"1941879b-8f74-4268-8e58-95dbbb90835d","year":2017},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.007976Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:9b15ae7b643e2bfe90f0b8e915434cfb97420dd0fa5db239d27e57888b839ea0","observation_id":"d5742c54-78ce-439f-acd9-f4858c731762","resolution":{"observed_at":"2026-08-10T14:27:09.727024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-10T14:27:09.014071Z","title":"Finit e scalar quantization: Vq-vae made simple,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.014071Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:dcd20bf6d28333a77d3be3bdadd2faabc45b4d6a0b93062f645d4fc350a05e4a","observation_id":"483913b3-fe05-46f2-a617-e6a317fdf08d","resolution":{"observed_at":"2026-08-10T14:27:09.014071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.708006Z","title":"High-ﬁdelity audio compression with improved rvqgan,","venue":null,"work_id":"7a984704-a000-409a-8e46-7abd413b83c3","year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.019677Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:1c8bfd825405eea94e050fb2b4586ce99a20c4bede3c458109cfda0c6b000b31","observation_id":"b299c320-1e63-46ff-8682-f3701a879f4d","resolution":{"observed_at":"2026-08-10T14:27:09.712327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14411","last_updated":"2024-10-18T12:24:05Z","snapshot_observed_at":"2026-08-10T23:38:29.960385Z","submitted_at":"2024-10-18T12:24:05Z","title":"SNAC: Multi-Scale Neural Audio Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14411","snapshot_observed_at":"2026-08-10T14:27:09.024591Z","title":"Snac: M ulti-scale neural audio codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.024591Z"},"links":{"cited_paper":"/paper/2410.14411","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:c35e2c4bbaec481c3cfe21191cb115060dc35af2502a8e87c41158e68a771b59","observation_id":"1c30ab33-fb6e-44df-9604-748d76e9988f","resolution":{"observed_at":"2026-08-10T14:27:09.024591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-10T14:27:09.030098Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.030098Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:d04b64436f61fc4a5fc2aecbd9bcf2a51373d5f854462070f77944255079c07b","observation_id":"ecdc0d7a-ce59-4dab-8e7a-cf9320779054","resolution":{"observed_at":"2026-08-10T14:27:09.030098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08742","last_updated":"2024-11-13T16:20:20Z","snapshot_observed_at":"2026-08-10T03:38:30.459521Z","submitted_at":"2024-11-13T16:20:20Z","title":"A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08742","snapshot_observed_at":"2026-08-10T14:27:09.035252Z","title":"A comparative s tudy of discrete speech tokens for semantic-related tasks with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.035252Z"},"links":{"cited_paper":"/paper/2411.08742","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:8339ffc2e5898bc43c014537c6d0ab34354b7e4a453aa7b9b9e1fd7e931edce8","observation_id":"cf075be4-d900-495b-b85f-80164947a406","resolution":{"observed_at":"2026-08-10T14:27:09.035252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-10T14:27:09.041296Z","title":"Qwen-audio: Ad- vancing universal audio understanding via uniﬁed large-scale audio- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.041296Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:5351badb722fa06401ec7cfe38a701308710978d21c6f1b536bd297f17ce7b86","observation_id":"dc7dbac0-f5eb-4f43-a2e6-060590170c4a","resolution":{"observed_at":"2026-08-10T14:27:09.041296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-10T14:27:09.046367Z","title":"Mini-omni: Language models can hear, talk while th inking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.046367Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:4bde0c01e29c9bc79f270e237872b1c0d6b41de4fed2265302f5c98357d66bd8","observation_id":"4297e96e-970e-4e22-817e-13e50c59578a","resolution":{"observed_at":"2026-08-10T14:27:09.046367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-08-12T11:26:26.736028Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-08-10T14:27:09.051470Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understand ing and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.051470Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:21527d98ed5c5e2b7b6b1d42a30110cf7828827559165cba7c533beef77f0686","observation_id":"14e6393b-9283-46b5-b13f-bf5f6b465aad","resolution":{"observed_at":"2026-08-10T14:27:09.051470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.694761Z","title":"wav2vec 2.0: A fr amework for self-supervised learning of speech representations,","venue":null,"work_id":"72df578b-8540-42d3-a5a7-e7beb80c52ad","year":2020},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.056593Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:57028c50773bc5b7e54ecf38650bb69c3a194d567a6a072171e6aedc18ec4252","observation_id":"ea4c6619-997a-4f60-90dc-9ae8e2f9b9c8","resolution":{"observed_at":"2026-08-10T14:27:09.698860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.680400Z","title":"Data2 vec: A general framework for self- supervised learning in speech, vision and language,","venue":null,"work_id":"50cbbbcf-2781-436a-a6d1-133e2e5fea09","year":2022},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.061310Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:0f6f5e6d88a3bf9fa1a0a0f652c25d24ec45a96696cf6cbda72234724562166c","observation_id":"c48c1a4a-613b-485f-b7d1-b28ec87a461e","resolution":{"observed_at":"2026-08-10T14:27:09.685160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.665790Z","title":"Sc aling up masked audio encoder learning for general audio classiﬁcation,","venue":null,"work_id":"79154b45-340d-4a7d-8a72-7cf4a4afd2fc","year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.066268Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:3fe69dede6352ad813ec4b313bc557dd12560248276d2b3778a6010c9faaecd0","observation_id":"6d92c814-716c-4c51-9d5c-ee968146577a","resolution":{"observed_at":"2026-08-10T14:27:09.670843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.651355Z","title":"HEAR: Holistic evaluation of audio representations,","venue":null,"work_id":"ca0a14bd-3250-4f1a-9775-137c15fc73be","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.071436Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:610188ebf31aba7c770dd2a67be5521dde78ecd8bc83f9994e05d2dc87b06a0f","observation_id":"b609f98e-8786-4cfa-9002-31e146495105","resolution":{"observed_at":"2026-08-10T14:27:09.656081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.636663Z","title":"SUPERB: Speech processing universal performance benchmar k,","venue":null,"work_id":"c586105d-d099-4fbb-ad75-e19dc4413f32","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.076302Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:cabaa45b521f6279627a3518654df431db40e940ed0d41e1b2f6e7ee68fc2d76","observation_id":"f699b613-476e-400b-81ac-938993fe15d6","resolution":{"observed_at":"2026-08-10T14:27:09.641396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-10T14:27:09.081166Z","title":"DASB–discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.081166Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:4eb6836eb0435c1527b9e3ef195a453793da77c2d8a88be5aa89903e388b7975","observation_id":"eac09b7b-2251-4600-8aea-229613780c1a","resolution":{"observed_at":"2026-08-10T14:27:09.081166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-10T14:27:09.086029Z","title":"Speech commands: A dataset for limited-vocabula ry speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.086029Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:5085a83fb58527b9f01ac8970d594398bdc37ebd67d2619c46a89e8292e0d9c2","observation_id":"2c95c848-6575-4f2f-b5a5-d8a8e783cf0f","resolution":{"observed_at":"2026-08-10T14:27:09.086029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.621746Z","title":"Lib ricount, a dataset for speaker count estima- tion,","venue":null,"work_id":"95c68232-85a7-4c54-8ae2-7f3695d4371e","year":2018},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.090811Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:c01fec9aa7ab3963edd26a69a8b9101e1ada82beb4016657002700bcef20298f","observation_id":"70681049-0a50-4aa7-bd9c-6ebbec8e85f1","resolution":{"observed_at":"2026-08-10T14:27:09.626585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.606848Z","title":"Voxlingua107: a dataset for spoken lan guage recognition,","venue":null,"work_id":"3fe44325-33f5-4541-a041-1daa1763a77c","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.094633Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:4665d77ed1c427ea515769987d37ab57f5525a44508ce15c62129afc4b0fa0c8","observation_id":"60ec8637-d5dc-464a-829a-f0eb4faa7e4b","resolution":{"observed_at":"2026-08-10T14:27:09.611650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.591664Z","title":"Voxceleb: L arge-scale speaker veriﬁcation in the wild,","venue":null,"work_id":"de318fb3-75cd-48a7-b52b-40052df0b36a","year":2020},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.098417Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:d15cefe868af45f6918a99ee547baf0cbcf28d369dd6c08b45ab3ee04996ec32","observation_id":"d4049d2a-85e2-4917-b84b-02feaa2f07a7","resolution":{"observed_at":"2026-08-10T14:27:09.596567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.576980Z","title":"Librisp eech: an asr corpus based on public domain audio books,","venue":null,"work_id":"a2302e8b-67ed-44c3-a794-ff08704dd85a","year":2015},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.102379Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:29f9cdd87462995d4d92c1d51edbf209df8a7a5138b8a57d660b05917a84b86f","observation_id":"4bfa7132-234c-4247-bc62-793d83ec73ea","resolution":{"observed_at":"2026-08-10T14:27:09.581761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03670","last_updated":"2019-07-25T17:56:23Z","snapshot_observed_at":"2026-07-06T07:44:28.011439Z","submitted_at":"2019-04-07T15:24:32Z","title":"Speech Model Pre-training for End-to-End Spoken Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03670","snapshot_observed_at":"2026-08-10T14:27:09.106687Z","title":"Speech model pre-training for end-to-end spoken language understanding,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.106687Z"},"links":{"cited_paper":"/paper/1904.03670","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:fb99c2a73d458ffb6d36d65e43fef32bb4a3f034046cb1505af39619da320f0a","observation_id":"08bbda33-2a61-404b-9116-d7ce1ba5c64b","resolution":{"observed_at":"2026-08-10T14:27:09.106687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.561965Z","title":"Vocalsound: A dataset for impro ving human vocal sounds recognition,","venue":null,"work_id":"177a948b-a2cb-4f9b-aeb9-4651214b2983","year":2022},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.111099Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:fee87cda5821edc7596640fff684e9c389a380bdc77c457918417acc3b3325f0","observation_id":"9a89e309-af28-4ec2-b079-a918ad385d20","resolution":{"observed_at":"2026-08-10T14:27:09.567012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.546089Z","title":"Crema-d: Crowd- sourced emotional multimodal actors dataset,","venue":null,"work_id":"d8bd32b4-412e-4634-8d42-152876dbf97e","year":2014},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.115119Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:580c7239052edf04e51d6309fc337406d25641d0d56dac7c06447786e788f43f","observation_id":"a1f097c8-add5-43fd-81b5-2c4f1967fcb2","resolution":{"observed_at":"2026-08-10T14:27:09.551485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.530680Z","title":"spee- chocean762: An open-source non-native english speech corpus f or pronunciation assessment,","venue":null,"work_id":"79e3ce00-d225-4032-92d0-1082849adcca","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.118950Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:7d69841a2a4ba9bcdaaed87cddb5fd89fd9b4f4cf35d2de2fdc9d78a5e9f847f","observation_id":"b199aac7-ee97-4346-ac42-95719c2825ad","resolution":{"observed_at":"2026-08-10T14:27:09.535715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.516871Z","title":"Autom atic speaker veriﬁcation spooﬁng and countermeasures challenge (asvspoof 2015) database,","venue":null,"work_id":"f7ed87ff-8cf9-4ed9-beb7-4f040d69114e","year":2015},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.123480Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:05a981c46fc8671825770f8cdbfaae046edd3226bcd881ce8aaf5692abc5252d","observation_id":"f72d2a44-6b37-4c5e-a149-b16d19d43ef7","resolution":{"observed_at":"2026-08-10T14:27:09.521154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.502138Z","title":"Esc: Dataset for environmental sound classiﬁc ation,","venue":null,"work_id":"651dfcd3-a18f-4070-aa6d-5d2a7d800d59","year":2015},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.128144Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:e7daadc4eb3048350681f8764baf7423314f6c5d3e8d0f43cfe1e788b367dd83","observation_id":"60ee67fa-45d4-45b6-b882-cf47dccb327d","resolution":{"observed_at":"2026-08-10T14:27:09.506592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.486894Z","title":"Fsd 50k: an open dataset of human-labeled sound events,","venue":null,"work_id":"788dd459-b956-4f85-9b54-a2cfe6e3e6f9","year":2021},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.132952Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:07bb58f1b79f31b74d1f6021305e8511e99bb1eea62fd9abfd4786d95c7611a5","observation_id":"647aa645-ec38-4b94-a432-7f7004b675eb","resolution":{"observed_at":"2026-08-10T14:27:09.491604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.470290Z","title":"A dataset and taxonom y for urban sound research,","venue":null,"work_id":"739cf661-5197-4bb6-811a-677ff7076ccb","year":2014},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.137432Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:cf490c9997855d16f43ead56327c5e5b86b3122dce5533498e60b4e79f716e73","observation_id":"734b0a95-283c-4511-8f8e-c31e0a3e67a5","resolution":{"observed_at":"2026-08-10T14:27:09.475397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.454405Z","title":"Sound eve nt detection in domestic environments with weakly labeled data and soundscape synthesis,","venue":null,"work_id":"eb10e364-5794-4d99-a418-6e9c51a5fbea","year":2019},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.142173Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:2ac41eb3e8fbdce229f4027f7599c8380af2ca80b4aeb6a33eb45671c7f77f49","observation_id":"0a8327d8-ad6c-4706-b9b9-af6b735cb42c","resolution":{"observed_at":"2026-08-10T14:27:09.459336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09902","last_updated":"2018-10-07T02:25:28Z","snapshot_observed_at":"2026-07-06T06:52:21.185384Z","submitted_at":"2018-07-26T00:30:54Z","title":"General-purpose Tagging of Freesound Audio with AudioSet Labels: Task Description, Dataset, and Baseline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.09902","snapshot_observed_at":"2026-08-10T14:27:09.146676Z","title":"General-purpose tag- ging of freesound audio with audioset labels: Task description, data set, and baseline,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.146676Z"},"links":{"cited_paper":"/paper/1807.09902","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:c80b559247c879911745472ef77eb21e5779a98b9bd88553b2bfe43e636a16e3","observation_id":"e0152afd-8583-423a-bc21-81ae392ac2b9","resolution":{"observed_at":"2026-08-10T14:27:09.146676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.438912Z","title":"Clotho: An audio capt ioning dataset,","venue":null,"work_id":"76a32974-1328-4d7b-a700-617e7915cd13","year":2020},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.151378Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:4f340cbd98bc87fdb2757654eccf4f2e379e70d67de87fdfbbe22aa27cc7eac9","observation_id":"4dd00642-a5e3-4629-bdde-1c92b4c6867d","resolution":{"observed_at":"2026-08-10T14:27:09.443976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.422688Z","title":"Enabling factorized piano music modeling and generation with the MAESTRO dataset,","venue":null,"work_id":"b42d6f77-1865-47ee-81ee-bbee1f3eb544","year":2019},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.155999Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:fc74503bbe6cc50bc54cdd7f973d52d089f6d65f4a98ae785582e351eee49011","observation_id":"99504da6-da4d-46c3-a1b1-a46ae6aebb4f","resolution":{"observed_at":"2026-08-10T14:27:09.427914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.1461","last_updated":"2013-06-07T16:57:39Z","snapshot_observed_at":"2026-07-06T03:15:15.663270Z","submitted_at":"2013-06-06T16:30:44Z","title":"The GTZAN dataset: Its contents, its faults, their effects on evaluation, and its future use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.1461","snapshot_observed_at":"2026-08-10T14:27:09.160670Z","title":"The gtzan dataset: Its contents, its faults, t heir eﬀects on evaluation, and its future use,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.160670Z"},"links":{"cited_paper":"/paper/1306.1461","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:96a59f874224e70aca9d386680678fc0c87d3e8604187fcfc92da6fedadcc7e5","observation_id":"c7b1239c-9c2c-4c2b-b75e-5b5ea524e3e7","resolution":{"observed_at":"2026-08-10T14:27:09.160670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:27:09.404278Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders,","venue":null,"work_id":"607695cd-a4c9-4a13-8742-6472ed9ef517","year":2017},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.165586Z"},"links":{"citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:69a9058e6a2ae6733dec16070ea6c8046bf15fc0104bb3e01182ade1adc2dda9","observation_id":"28403eb4-d70b-49f0-9d15-1e0ec430e1a5","resolution":{"observed_at":"2026-08-10T14:27:09.411329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-07-06T05:21:33.309016Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-10T14:27:09.170151Z","title":"Fma: A dataset for music analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:27:09.170151Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2501.15302"},"observation_digest":"sha256:0aa00dc2fcc49d0dfa597dc4a6d26e7d07cedcad19db850af2936b6114346ece","observation_id":"f443ba02-0d14-4007-91a0-ad1005d83722","resolution":{"observed_at":"2026-08-10T14:27:09.170151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15302","last_updated":"2025-01-25T18:56:40Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T16:26:46.134189Z","submitted_at":"2025-01-25T18:56:40Z","title":"The ICME 2025 Audio Encoder Capability Challenge"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2501.15302."}