{"as_of":"2026-08-11T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bcdb113dbd07bb289bbc4447b591c8af5a2dd57e6abeba2a846fdcff7f38f10e","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:59:54.697271Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T22:56:12.155077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:20:04.574271Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"cited_work":{"arxiv_id":"2506.12285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12285","snapshot_observed_at":"2026-07-04T18:20:04.574271Z","title":"CMI-Bench: A comprehensive bench- mark for evaluating music instruction following,","venue":null,"work_id":"55cc9225-eb93-45f7-899a-9d86e76780e5","year":2025},"citing_paper":{"arxiv_id":"2606.24123","last_updated":"2026-06-23T04:14:07Z","snapshot_observed_at":"2026-08-06T09:18:37.300889Z","submitted_at":"2026-06-23T04:14:07Z","title":"Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T22:56:12.155077Z"},"links":{"cited_paper":"/paper/2506.12285","citing_paper":"/paper/2606.24123"},"observation_digest":"sha256:8b15e17f61e80efe8b5a4647ad901f8a586d008eb521ad7b266607287b51cdc5","observation_id":"f3511643-238b-4973-bace-ca6e1b6db628","resolution":{"observed_at":"2026-07-04T18:20:04.575924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12285/citation-record","integrity":"/paper/2506.12285/integrity","json":"/paper/2506.12285/citation-record.json","paper":"/paper/2506.12285"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T00:59:47.015250Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:47.015250Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:311fa857b172b40d754b9a5bfb81fb8c2a64864250af1cd9b1fa4d5e56c57595","observation_id":"684b17f7-5111-4078-8de9-d5e521665892","resolution":{"observed_at":"2026-08-07T00:59:47.015250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14340","last_updated":"2024-09-03T14:53:34Z","snapshot_observed_at":"2026-07-06T19:06:01.833508Z","submitted_at":"2024-08-26T15:13:14Z","title":"Foundation Models for Music: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14340","snapshot_observed_at":"2026-08-07T00:59:47.112119Z","title":"Foundation models for music: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:47.112119Z"},"links":{"cited_paper":"/paper/2408.14340","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:a9ad416e092efd0f8a52aa0e6a6e665a3c056b8c750fd5a96e832d149053a946","observation_id":"98e6c135-305a-4f67-b27b-19101663bd6b","resolution":{"observed_at":"2026-08-07T00:59:47.112119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:02.528633Z","title":"Bb major","venue":null,"work_id":"34f4c6c9-1249-4636-b680-b78cd3fbb5bb","year":null},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:46.667141Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:517242a6335c7a673e6b1c02cdf8c7e413c3c23c7b9a80f5c26b5a7a62376f83","observation_id":"4b685c90-3e78-45be-aa3f-d510fa926a76","resolution":{"observed_at":"2026-08-07T01:00:02.555134Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:02.467131Z","title":"lyrics is as fol- lows:","venue":null,"work_id":"05ddfe04-7c54-446c-9618-e24a0b04d2af","year":null},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:46.719670Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:b860f686d0db124b5f0b8e29c85266d86ca31de4bc8e78402a7e482c8918267e","observation_id":"2d33f25e-36fa-4937-a66e-80f861d710d4","resolution":{"observed_at":"2026-08-07T01:00:02.496111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:02.306073Z","title":"<|pitch|><|midi_pitch|>piano","venue":null,"work_id":"f8048e4a-1a46-4c38-96ed-91247e2e49c4","year":null},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:46.827249Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:d293484481c0da3167c194257a563cd91b993cbea5553a86f0da260ea4a24f0e","observation_id":"3853d8a3-29de-48e3-8523-95e08496aab5","resolution":{"observed_at":"2026-08-07T01:00:02.437054Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:02.042681Z","title":"Our results highlight a significant performance gap between LLMs and supervised MIR systems, with best models like Qwen2-Audio and GAMA also struggling with general- ization","venue":null,"work_id":"ae2ff0e8-bc05-46fb-b5c1-e2ddd92627ac","year":null},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:46.914418Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:09c8421c5947fd3afad3f9f21b36c8934efe83d166ed42aa1cbedaf7c7c02995","observation_id":"78c10dc0-67dd-4771-b576-7e06c6063283","resolution":{"observed_at":"2026-08-07T01:00:02.156421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:01.855165Z","title":"Music un- derstanding llama: Advancing text-to-music generation with question answering and captioning,","venue":null,"work_id":"b0ca7967-5bf3-417e-9ec3-3be5900ea153","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:47.195730Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:6f79241838b1fc8b522533ca860c79c2dd9427a270d28cd501f5138514ff6b72","observation_id":"2da629c2-6f6f-4180-9d2e-756142139bba","resolution":{"observed_at":"2026-08-07T01:00:01.981855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:01.640123Z","title":"Musilingo: Bridging music and text with pre-trained language models for music captioning and query response,","venue":null,"work_id":"867819ae-6828-474c-ad61-4ee0e168db4e","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:47.338964Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:b32ee9cf0537bcf01e66678e69dce758b9b097b839998e2c6b47819a5a599286","observation_id":"f37ea6e1-b5eb-4b5c-9ece-7c3b29ad3fb4","resolution":{"observed_at":"2026-08-07T01:00:01.716522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T00:59:47.489421Z","title":"Qwen-audio: Advancing univer- sal audio understanding via unified large-scale audio- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:47.489421Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:b048c9a75fedc70e4611f806f0e864ad9b48acd85c5eafad33f6a46d862aaf97","observation_id":"8896056a-15a9-4ce6-a305-9062f93dac1b","resolution":{"observed_at":"2026-08-07T00:59:47.489421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:01.429267Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":"0641cc10-dd7d-46d5-8a40-35a51499c63a","year":null},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:47.600429Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:052732d404c70266f1d4fdeae55c6e1bdf66e79232023f7290db8f4ae8ea650c","observation_id":"44f6bc30-d31e-4d41-bba0-5a3516dd150b","resolution":{"observed_at":"2026-08-07T01:00:01.527054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:01.173383Z","title":"Air-bench: Benchmarking large audio-language models via genera- tive comprehension,","venue":null,"work_id":"1bf72d8a-08c6-4ab4-b102-79524f91e2d9","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:47.711498Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:52ed642a922b72b095c53ac511fb66eb71d32d6ac6cfbfc45ecbe78186a3a36a","observation_id":"d2d66bef-2ad5-4044-bdf6-1088a745a6ba","resolution":{"observed_at":"2026-08-07T01:00:01.324028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:47.828453Z","title":"Muchomusic: Evaluating music understanding in multimodal audio-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:47.828453Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:7acb58df891d7e42a0eb4927ed7fc34dbd9887eb6d70510cc6bdacc216df9d1c","observation_id":"727fd874-b59a-4190-9410-1be4d3b10515","resolution":{"observed_at":"2026-08-07T00:59:47.828453Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:47.941116Z","title":"Omnibench: Towards the future of universal omni-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:47.941116Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:1668f6e8467d093d14f0a6377e26183f443131577aef86e88af4bcdc1b68190e","observation_id":"ca365523-3cf6-4c93-bd33-523d14eb0749","resolution":{"observed_at":"2026-08-07T00:59:47.941116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:00.798825Z","title":"Mmau: A massive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":"0f85fe76-a3c2-4957-a715-fa79433a790b","year":null},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.054038Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:70a54f74dc29b2aa3c7edd6b5ff4ca1ffaba86e7aa7c02766d7556d379749986","observation_id":"19e784b1-4dcd-43e4-aed4-0955df291ef5","resolution":{"observed_at":"2026-08-07T01:00:01.009900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:00.500017Z","title":"Super- naturalinstructions: Generalization via declarative in- structions on 1600+ nlp tasks,","venue":null,"work_id":"a3b0b324-f872-490e-bc4f-8bc16a0b508c","year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.174260Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:9a96a891a6e5865fac4635e0aa18822fbbe717291ad33bfd434794cf7768b1df","observation_id":"fb4d7c88-af1e-46ae-954e-5709a0ba6f26","resolution":{"observed_at":"2026-08-07T01:00:00.617001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:00.366455Z","title":"Self-instruct: Aligning language models with self-generated instructions,","venue":null,"work_id":"761f68f3-f723-40c5-a14d-c5c8e7e9cf31","year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.249279Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:496b7083c2e35d0f6e438013b26e83416e64ac7e60172d1347d806a69cefa861","observation_id":"23115682-6fa3-441a-851d-471f9c93a5dd","resolution":{"observed_at":"2026-08-07T01:00:00.458878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:48.358531Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.358531Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:b3e265e06445d47f542451e9430c50adee6cd2d25c46e54fe8f1ea7347fdeadf","observation_id":"a2fa1b2c-662d-42a0-8606-8ddb18d38172","resolution":{"observed_at":"2026-08-07T00:59:48.358531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16584","last_updated":"2026-06-07T13:34:59Z","snapshot_observed_at":"2026-08-07T17:55:10.844258Z","submitted_at":"2025-02-23T14:24:15Z","title":"Audio-FLAN: An Instruction-Following Dataset for Unified Audio Understanding and Generation of Speech, Music, and Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16584","snapshot_observed_at":"2026-08-07T00:59:48.455745Z","title":"Audio-flan: A prelim- inary release,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.455745Z"},"links":{"cited_paper":"/paper/2502.16584","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:a5febb642f8e3418dcd4c6fdd46cd4d7b65d827a76345897676f8a86efe4ba08","observation_id":"f3cebebc-7ee3-4b16-aedb-bbfaf4125ffb","resolution":{"observed_at":"2026-08-07T00:59:48.455745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:00.224253Z","title":"The music maestro or the musically chal- lenged, a massive music evaluation benchmark for large language models,","venue":null,"work_id":"a1a313d3-84a7-47e7-85f1-3e84307e506a","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.588509Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:64ffd6f292b8b4fb1bcad270d92b97ce028650eedfd8a70c6c65fc75e49f40fc","observation_id":"f1bc91d3-d972-4fcd-ac9f-b5cb4959366c","resolution":{"observed_at":"2026-08-07T01:00:00.286880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16020","last_updated":"2025-05-06T00:52:19Z","snapshot_observed_at":"2026-08-09T08:14:08.234350Z","submitted_at":"2024-06-23T05:40:26Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16020","snapshot_observed_at":"2026-08-07T00:59:48.715523Z","title":"Audiobench: A univer- sal benchmark for audio large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.715523Z"},"links":{"cited_paper":"/paper/2406.16020","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:209b12f1a81a623d04b203a702c3cc4f3d67313ed8bb543f65a6a8ed803745ab","observation_id":"6512d42e-079e-4ed9-8525-b66be04faeb0","resolution":{"observed_at":"2026-08-07T00:59:48.715523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:00:00.076946Z","title":"Mustango: Toward con- trollable text-to-music generation,","venue":null,"work_id":"572f1ed2-4c47-4998-a261-9eca0e24b7b1","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.839745Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:1c05e009678ef839001cb2a7126b45efd3a4c132cfc8cdc673bc367e33116e3a","observation_id":"a00b136e-b7bf-4fbc-baae-2831be7004a8","resolution":{"observed_at":"2026-08-07T01:00:00.135848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:59.930597Z","title":"Muchin: a chinese colloquial description benchmark for evaluating language models in the field of music,","venue":null,"work_id":"b89cc480-edc0-479f-ac04-0f900e3285eb","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:48.993977Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:b2a999b4ac880836dc26dff06df1eaa3b10147521db6a22685d9ab2bf734f8a8","observation_id":"50f79950-1caa-4900-916c-e4536baf2ec1","resolution":{"observed_at":"2026-08-07T01:00:00.001258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:59.734853Z","title":"Listen, think, and understand,","venue":null,"work_id":"beacb4f5-1531-449e-af58-c1d9ab0352b7","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:49.108274Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:256d0b07d884543c6e81a6fd5830594686fd8500b230106d6d4b2ea4c3ba1f9e","observation_id":"27745585-6308-41a9-a9ac-4f176510a8e8","resolution":{"observed_at":"2026-08-07T00:59:59.810676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:59.592707Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"13db9d1c-6e0d-4310-a219-98f1e0c08eaf","year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:49.231844Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:f5d30d17e3f02eb46ac82bfd9b70f36e3c54a8aedf682efbb7871b55e0b2094f","observation_id":"bc3a17cc-5fe4-4c0f-be73-4fb22be472aa","resolution":{"observed_at":"2026-08-07T00:59:59.653032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T00:59:49.340105Z","title":"Robust speech recognition via large- scale weak supervision (arxiv: 2212.04356). arxiv,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:49.340105Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:6c00d15ad222e7d6a22e5ebe221bbd588f761961ea4a1bf4da5ce12671cf8b0f","observation_id":"1cdb8260-90bf-493d-bc95-08b50280516b","resolution":{"observed_at":"2026-08-07T00:59:49.340105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:59.454913Z","title":"Llark: A multimodal instruction-following language model for music,","venue":null,"work_id":"cfeac192-f938-4e3f-af47-f81753874a03","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:49.476901Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:a432abac9ee115987405799ae286e6bea719acb42ffe73dc2e9de2d4bd67acb3","observation_id":"ed66b6a3-180e-4a7d-a827-558ccf5191e3","resolution":{"observed_at":"2026-08-07T00:59:59.506565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:59.325351Z","title":"Pengi: An audio language model for audio tasks,","venue":null,"work_id":"a4bf1226-9adf-4035-bbda-d973e52b8eca","year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:49.660592Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:f036c1873a1e03ac0a3ce8c04f1040740f3b0a454f2654cb88167795b7478b67","observation_id":"f9aa59e1-57de-4459-9d14-fadac758bd4a","resolution":{"observed_at":"2026-08-07T00:59:59.390949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:59.172473Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities,","venue":null,"work_id":"7ba76c35-1175-464f-be81-41661a9800ab","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:49.797826Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:715d7b5e994cd45771190fa6db978008d0aa1728e563fa0d3c8928ac21297536","observation_id":"4f738db5-dec1-4378-8d80-99133b2cdfa3","resolution":{"observed_at":"2026-08-07T00:59:59.247283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T00:59:49.932722Z","title":"Qwen2-audio technical re- port,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:49.932722Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:9db9592994205879b03500e22f6bf5009cd832eecb7274f6c291840198ed824b","observation_id":"892f6c72-d928-422d-b99a-25b72ebdd5da","resolution":{"observed_at":"2026-08-07T00:59:49.932722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:59.011997Z","title":"Audio flamingo: a novel audio language model with few-shot learning and dialogue abilities,","venue":null,"work_id":"0a198170-fa2f-4d68-8026-c780b2b244c4","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:50.085603Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:afb30983484a480a685e4411bb0a6133d1737535bc868c30008ea64868cfd0b1","observation_id":"4ecff02e-0733-4f26-ba9e-ec3411572366","resolution":{"observed_at":"2026-08-07T00:59:59.062952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-07T17:26:13.091608Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-07T00:59:50.218454Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abili- ties,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:50.218454Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:925e7d1493c02463e81a2cff8651002e8be8f351774f22521c306e9ef73c14c1","observation_id":"f78fe07d-4bdf-4cf2-8357-5353d91130da","resolution":{"observed_at":"2026-08-07T00:59:50.218454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.826448Z","title":"Mir_eval: A transparent implementation of common mir metrics","venue":null,"work_id":"58c41139-7707-479b-8e1c-d739416d56d0","year":2014},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:50.366905Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:4a0ded0b43d27e1f3fad650d7ed560ce26b728403ccae7322b8fae52e9a63e8c","observation_id":"c09fe8cc-8e43-4f87-b1e5-85b33e1d3d18","resolution":{"observed_at":"2026-08-07T00:59:58.907032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.693392Z","title":"Two data sets for tempo estimation and key detection in electronic dance music annotated from user corrections,","venue":null,"work_id":"727836c6-5c80-42d3-ba9d-b3459bc859a4","year":2015},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:50.533952Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:8b92f0353028be0e4a85ab1f176370423ffc62a84357833d36a020703f76ac4c","observation_id":"c9162a5f-7160-4d18-8a01-6351e6f978cb","resolution":{"observed_at":"2026-08-07T00:59:58.754969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.570414Z","title":"1000 songs for emotional analysis of music,","venue":null,"work_id":"b3d3a131-3cab-4a14-9c96-ee6a6452e796","year":2013},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:50.635760Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:d5551381df05e43ad32c4aa6faded74050c5f9cb2b7c223444a97ebe7553cdb4","observation_id":"7adc66ed-1ad0-4f35-bec3-b2d7bd12b7fb","resolution":{"observed_at":"2026-08-07T00:59:58.618620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.470246Z","title":"Evaluation of algorithms using games: The case of music tagging","venue":null,"work_id":"1c81c01b-c5d5-4277-a2fd-8c802afc097a","year":2009},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:50.751980Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:f7630dde7f851287c9cae1dd3bba52cf1be1d017dfd4aeb6766467b3a6eaf030","observation_id":"cb3f78fe-9a1f-4bd9-9197-20948d6b6164","resolution":{"observed_at":"2026-08-07T00:59:58.514987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.341301Z","title":"The mtg-jamendo dataset for automatic mu- sic tagging,","venue":null,"work_id":"8de31b76-3f05-4386-bd8c-a51283bb600f","year":2019},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:50.883303Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:821d3d873f154e3157831df101c779c600b492ca1f58be7d5810ca2529196088","observation_id":"4c1f5a79-f18a-4856-a77a-4e84c1cd0e4a","resolution":{"observed_at":"2026-08-07T00:59:58.400405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:51.031177Z","title":"Neural au- dio synthesis of musical notes with wavenet autoen- coders,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.031177Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:3fe2ac966b7d1276bcf7d2d3b77fc57e24df115566ff5be1ef7affab9341bd2a","observation_id":"228b5005-b7f9-49f1-ba16-4f910ca3a726","resolution":{"observed_at":"2026-08-07T00:59:51.031177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.142734Z","title":"Musical genre classifica- tion of audio signals,","venue":null,"work_id":"c9cb5210-1c5e-4d91-b559-420f888d04cc","year":2002},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.136254Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:3ea60e25cbceb834c10c63843562d24fa8d94fbc5632a46ff183be62dde0658b","observation_id":"1c2bf367-e18e-4ff0-91ef-e0b9f072e242","resolution":{"observed_at":"2026-08-07T00:59:58.249085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:51.226866Z","title":"V ocalset: A singing voice dataset","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.226866Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:0618f76396597bb028b5fd17168f9d2b41ba2bf2ef9caf6fb79c0d8f886881b9","observation_id":"b802d8ac-7554-45e5-91df-cbaae1f6451b","resolution":{"observed_at":"2026-08-07T00:59:51.226866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-07-06T16:48:44.861171Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-07T00:59:51.335865Z","title":"The song describer dataset: a corpus of au- dio captions for music-and-language evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.335865Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:fc5f7627d07685926a4400d0118d2c9eb014fe0375a7b95e03452fd9deb9a7d2","observation_id":"b0b1ea75-6461-43bb-b90d-d39239aead62","resolution":{"observed_at":"2026-08-07T00:59:51.335865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-07T00:59:51.461724Z","title":"Musiclm: Generat- ing music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.461724Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:e19253f6d70e798bc26c619f6836594ea6ac321de3cda073e6f09ff4de1a5557","observation_id":"1c1fa0bf-917d-41d6-8352-6f905588f23c","resolution":{"observed_at":"2026-08-07T00:59:51.461724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:58.003344Z","title":"Automatic lyric tran- scription from karaoke vocal tracks: Resources and a baseline system,","venue":null,"work_id":"fc21b809-d5d6-4b6c-bd0c-a11098060cbc","year":2019},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.540461Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:7ddd1681679ee86bf622359a5b91cf0c26f35b1c5d7b9dbd2f58537bc5282438","observation_id":"e4305355-38e1-4008-8782-b3ac53aa9375","resolution":{"observed_at":"2026-08-07T00:59:58.069888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.838991Z","title":"An experimental com- parison of audio tempo induction algorithms,","venue":null,"work_id":"2c7068f9-7bb6-4e31-9520-2d95d2442f13","year":2006},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.672384Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:adac87c1f2ea9943ae7e257bdcfc3cc0c602999dba8d4ec110e320d4d1cc9838","observation_id":"bc13d3b5-1045-4025-93e7-9ab85e62f820","resolution":{"observed_at":"2026-08-07T00:59:57.928569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.729436Z","title":"Rhythmic pattern modeling for beat and downbeat tracking in musical audio","venue":null,"work_id":"116e66f7-e26d-4736-8767-01578d006bea","year":2013},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.778658Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:54bac1b628a4c2ebde9b250266e064b327918cd5e717a271a0a6e041538faa39","observation_id":"ffc540d3-6249-4418-994b-e2e013eb6b4c","resolution":{"observed_at":"2026-08-07T00:59:57.771138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.575211Z","title":"Medleydb: A multitrack dataset for annotation-intensive mir research,","venue":null,"work_id":"959d37fa-a451-4e9a-a5a0-8d04cc689347","year":2014},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:51.911339Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:4c9dcbc7ba0074d51147e86ddebcf79eb5caf24d7452712273413c8bc2895c00","observation_id":"ef13e0c0-4ee7-4d96-9136-b98fa7941df0","resolution":{"observed_at":"2026-08-07T00:59:57.666945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.465395Z","title":"Frame-level multi-label playing technique detection us- ing multi-scale network and self-attention mechanism,","venue":null,"work_id":"5e34455c-553f-4050-bfa3-efc9862da92b","year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:52.075673Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:682b3b32b42ee95c555e72dbbd6f4350e623c810b266ec5b80d1276ed52cff8b","observation_id":"7949c43e-6b39-483d-9115-751597e0c283","resolution":{"observed_at":"2026-08-07T00:59:57.516977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.321303Z","title":"C-pack: Packed resources for general chinese embeddings,","venue":null,"work_id":"3595a648-7ce4-4759-8a38-c80c28567739","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:52.198647Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:52dc0261f4fcaf9befb052c5c9010007e9e8726b10321d76278cfcaa21017e46","observation_id":"610fcf89-0803-47a3-a6f3-f8cea7922add","resolution":{"observed_at":"2026-08-07T00:59:57.400158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.212507Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"1e99b612-061a-49ac-bbee-8189173d8ecb","year":2002},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:52.331796Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:f3d5d3826406117dd2a4084a99fa16ce3950cbc5da01e08fc84fb87e1b081ce5","observation_id":"39adb415-1720-468e-b5f7-cb6c1ae2ced0","resolution":{"observed_at":"2026-08-07T00:59:57.250681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:57.097723Z","title":"ORANGE: a method for evaluating automatic evaluation metrics for machine translation,","venue":null,"work_id":"be16230e-ad7e-4d85-ab4f-ace64c670289","year":2004},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:52.434976Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:051d5b03ee028e319de7b30e637f39b797155dc94c2e1e4da06336860097d804","observation_id":"e286ce2e-0050-4b7d-95b3-6933e189c3e8","resolution":{"observed_at":"2026-08-07T00:59:57.156054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:52.587272Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:52.587272Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:79956d0c533fbf40d18a12b5504718987bef78f49a5450928f6fd5091f8a80ae","observation_id":"375dafc8-c1bf-49c6-b964-603a2f0f8b74","resolution":{"observed_at":"2026-08-07T00:59:52.587272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.971895Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":"6ecacf7c-0f75-49f2-bba0-5b477b73b7d3","year":2004},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:52.680686Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:8c6abe8847a218c9be1d60a2e45a49cbd7aa062d78f9f160ddb463c66e0532a7","observation_id":"e79dfc2d-9b61-4bc6-a0ad-157255f3fb31","resolution":{"observed_at":"2026-08-07T00:59:57.031782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.853298Z","title":"Bertscore: Evaluating text generation with bert,","venue":null,"work_id":"dedde432-729c-4881-88a8-926d2e0c3e3a","year":2020},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:52.812252Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:79733580c33877bb257e7e276b823e57a2fb5b8f773ba44d38af78deb27ed3b1","observation_id":"d3c9b098-895c-48c1-8375-f844593eda3c","resolution":{"observed_at":"2026-08-07T00:59:56.920509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.738718Z","title":"End-to-end musical key estimation using a convolutional neural network,","venue":null,"work_id":"50387dc1-ae60-47be-823f-36901d80aa93","year":2017},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:52.917247Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:d97c726f5c09956bbd10bcc970fe53168b044ad0f8583564006cc0e13d4a2e23","observation_id":"e19f2c9e-ee20-45d6-bd77-882db86dd2aa","resolution":{"observed_at":"2026-08-07T00:59:56.789384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05677","last_updated":"2021-07-12T18:28:50Z","snapshot_observed_at":"2026-08-10T05:18:06.410873Z","submitted_at":"2021-07-12T18:28:50Z","title":"Codified audio language modeling learns useful representations for music information retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05677","snapshot_observed_at":"2026-08-07T00:59:53.056721Z","title":"Codified audio language modeling learns useful representa- tions for music information retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.056721Z"},"links":{"cited_paper":"/paper/2107.05677","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:5eedc006a5ad698748979ce32210aed67b799900cb9c7d4c2997506fc0828af0","observation_id":"f053fbdc-f007-4176-b7d4-82c4dcc87072","resolution":{"observed_at":"2026-08-07T00:59:53.056721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.628726Z","title":"Marble: Music audio representation benchmark for universal evaluation,","venue":null,"work_id":"ff34ff33-c31a-4cdc-847c-c3128910336e","year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.190839Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:3b02531a22f19892a6b2be3be066aba0430a1b62c6336c4d3287b1c389a3190e","observation_id":"bfd562a7-0fea-421e-9716-12d1e985f050","resolution":{"observed_at":"2026-08-07T00:59:56.682541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-07T00:59:53.301995Z","title":"Mulan: A joint embedding of music audio and natural language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.301995Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:6af203cd0840f049baad675dd1cb431de8f17eda8c8753c7850d37fcea03d00d","observation_id":"208e4dfc-25bf-4969-9ca7-b30bbad69288","resolution":{"observed_at":"2026-08-07T00:59:53.301995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.517910Z","title":"Supervised and un- supervised learning of audio representations for music understanding,","venue":null,"work_id":"7bba9496-5580-497d-b4e8-97a75c0c4f09","year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.391529Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:f6c3858a0e022748a84d8fa4523ef00806be9d499cc842a6a86b9f1bd0cc9638","observation_id":"d7279f5d-6636-499b-8c0b-7b152340ec5c","resolution":{"observed_at":"2026-08-07T00:59:56.557043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.383262Z","title":"Music representation learning based on editorial metadata from discogs,","venue":null,"work_id":"fa7434d6-7be2-4935-9753-cfac55872a9a","year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.545091Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:986d64abed9a62f274b3490c7eaf6c0f59d1c944044ade5bb82c8550b07fd0a4","observation_id":"01e4b000-2da2-450c-b0ef-d3e5f85e3776","resolution":{"observed_at":"2026-08-07T00:59:56.456727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.288795Z","title":"Masked modeling duo: Learning repre- sentations by encouraging both networks to model the input,","venue":null,"work_id":"4ca0af94-da23-4479-bdd1-be434ad3a528","year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.654047Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:78a2e8d90186bd1a7c31b160eed0166ea7f94ec277f57ab5c74d2065facf6d6d","observation_id":"71bc3fb5-bc40-44e7-a70f-16c389c26076","resolution":{"observed_at":"2026-08-07T00:59:56.322645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.182290Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training,","venue":null,"work_id":"3118878c-5403-4c1d-8bb8-65233c4eccfa","year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.731329Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:a6831b6cc4384bfa94d5e93f43a11c20973ecb1eb13187eb4da9d6b2fb3b950d","observation_id":"9f53aff9-5812-4459-8b6a-9136edd6a67c","resolution":{"observed_at":"2026-08-07T00:59:56.237995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:56.085694Z","title":"Towards learning universal audio repre- sentations,","venue":null,"work_id":"6298e4fa-edce-4acf-ab70-a07b38cfd456","year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.846748Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:3b8846753f98f76d4122f295f968b50570cbb46ce4b5851c2e049428e0f50c21","observation_id":"d53d5a63-3acc-4bf5-9d11-c3d0341b1403","resolution":{"observed_at":"2026-08-07T00:59:56.135872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.994998Z","title":"Lp-musiccaps: Llm-based pseudo music captioning,","venue":null,"work_id":"ee8e91da-e0ec-4561-86d6-ed4e1636c2ea","year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.983172Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:04afdc259fb4bcf34464ac058cc0a7076bd2f06d64933450df9f8828f07692b5","observation_id":"26a869b5-db92-4c96-8173-3c696efdbe39","resolution":{"observed_at":"2026-08-07T00:59:56.028410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.889017Z","title":"Transfer learning of wav2vec 2.0 for automatic lyric transcription,","venue":null,"work_id":"4e76be8b-e851-4cd7-a6ba-ef497ac89666","year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:54.107856Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:54daa55218eeb82ad494a1c1598d258b813f87a8e8bbce24e36bd924829e7683","observation_id":"f5e4575d-a204-4bdf-b639-d27d227e01b7","resolution":{"observed_at":"2026-08-07T00:59:55.927817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.777334Z","title":"Beatnet: CRNN and particle filtering for online joint beat, downbeat and meter tracking,","venue":null,"work_id":"29f03b0a-aada-4962-a6f2-49827b98b6a2","year":2021},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:54.221604Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:cfca0f8d8618f7590a04dec1364ff8d6f4aad8d351392c1d4538d9e9dbeda617","observation_id":"a84db855-2524-4abb-9305-0e899118287a","resolution":{"observed_at":"2026-08-07T00:59:55.815080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.678543Z","title":"Beat transformer: Demixed beat and downbeat tracking with dilated self-attention,","venue":null,"work_id":"c45e0a85-15c8-482d-9e21-7aba74105fc4","year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:54.332030Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:aa83790425d134ad35a18f5ebf1d86b88b44b2c5a1f7d7c6ca27d0c470421ff3","observation_id":"d9cefe7e-d4ff-4c06-a639-1a1a082e01cc","resolution":{"observed_at":"2026-08-07T00:59:55.725299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.560432Z","title":"Hkdsme: Het- erogeneous knowledge distillation for semi-supervised singing melody extraction using harmonic supervision,","venue":null,"work_id":"2db56c3a-6635-48e3-b721-aa0ce737d595","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:54.464552Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:4aca427bdc26350c90cbef4cb4b8f717735588e38152d4a77668707d55bde24b","observation_id":"d6faeaf2-643c-4cde-95c1-b3c555844f16","resolution":{"observed_at":"2026-08-07T00:59:55.601178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.462794Z","title":"Mertech: Instrument playing technique detection using self-supervised pretrained model with multi-task finetuning,","venue":null,"work_id":"6e5b9d91-4606-444a-bfdc-9f6e01cb3f74","year":2024},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:54.563389Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:788eddf350a0083f556de318738de0043465d81181ccb4edace9c471739d746f","observation_id":"eb9f372e-e8f4-48b9-9995-c97fae5877b8","resolution":{"observed_at":"2026-08-07T00:59:55.510116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"wav/4693198","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:59:55.015226Z","title":"Lyricwhiz: Ro- bust multilingual lyrics transcription by whispering to chatgpt","venue":null,"work_id":"68b8556e-2eff-44bd-ac0f-eb839be5239c","year":2023},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:54.697271Z"},"links":{"citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:9d96cd3424788093a364090ec1523623db087ec8d83333a03c97dea463e17eb6","observation_id":"b3cd84ab-3512-4729-9e57-905cb4169a1b","resolution":{"observed_at":"2026-08-07T00:59:55.090539Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-11T10:10:41.876693Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2506.12285."}