{"as_of":"2026-08-17T14:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59c8748bb04001b740d849be992dd61a669964656bd5802cc73c9c195558f0c6","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:55:00.742512Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.19514/citation-record","integrity":"/paper/2508.19514/integrity","json":"/paper/2508.19514/citation-record.json","paper":"/paper/2508.19514"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T16:55:00.610051Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.610051Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:877099c7b974e25f96bb972507d6af9e226a92d49af0a1dba13c1c1fafffea6c","observation_id":"10477540-6dc0-4212-83af-8f16599990ca","resolution":{"observed_at":"2026-08-15T16:55:00.610051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-15T16:55:00.614509Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.614509Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:27a22fd8436e8d7203c862748cc21dd5c9b6757e7cb25ea8dbdc01e792e8c2d0","observation_id":"f4ada9a7-2fe4-4deb-b747-a2a5384298d9","resolution":{"observed_at":"2026-08-15T16:55:00.614509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:00.618724Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.618724Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:50492cae4dbb1fb1084ab3ac1234c1067b55195a645f735c7d5d39d0647b16f2","observation_id":"ae3f328d-7c54-4003-a195-0735b70d595d","resolution":{"observed_at":"2026-08-15T16:55:00.618724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.138296Z","title":"Music understanding llama: Advancing text-to-music generation with question answering and captioning,","venue":null,"work_id":"31290d02-0e96-41f4-9b89-4e55649f2a42","year":2024},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.622548Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:751886e1fb35d730ee02dcbbe2e16b014faabc443889eec9d9dfdb261d846240","observation_id":"4045a1a5-c532-4a2c-8a78-d268c3859b30","resolution":{"observed_at":"2026-08-15T16:55:01.142731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-08-17T12:24:00.878640Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-15T16:55:00.626491Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.626491Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:9787d5d9f642b49f881148e992be5083721da6ca40c9792d83f66bab41563460","observation_id":"59c75b42-48eb-48d2-87b9-7f7698e8b669","resolution":{"observed_at":"2026-08-15T16:55:00.626491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-15T16:55:00.630570Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.630570Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:d32c1243435dbf9e9aae4bb2ed71c6c4f98d94026bd5ee03d424dad5c719904b","observation_id":"fe2c1a58-46d8-4487-a809-986289938d0b","resolution":{"observed_at":"2026-08-15T16:55:00.630570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-17T00:14:01.413100Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-15T16:55:00.635201Z","title":"Emergent abilities of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.635201Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:90451c862eec35d727d190a0d0a50296331c7354e972454fd64949a16843d1f3","observation_id":"34441854-4cd0-4d46-89b0-15308cfd3a14","resolution":{"observed_at":"2026-08-15T16:55:00.635201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.127545Z","title":"Are emergent abilities of large language models a mirage?,","venue":null,"work_id":"920ebbe6-a830-4b00-8081-f18ae26c4731","year":2024},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.639037Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:36e4f55c4c7da0bf176d73c8539190a4659730eae55f79e31d1161a5bcdc6037","observation_id":"262decf8-710f-43bd-be06-fe78fe43b54d","resolution":{"observed_at":"2026-08-15T16:55:01.131495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-15T16:55:00.642522Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.642522Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:7889d318ed4d532cd5e0a45cb260e0957b086adff643a251a6374e071ab3ee25","observation_id":"1d10eb41-f03e-42e0-ab17-e4128f0a4ac8","resolution":{"observed_at":"2026-08-15T16:55:00.642522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T16:55:00.646295Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.646295Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:566879d3278c7892ea9ea739ec15a33d117c9c11f1abed80576c310e71fc0e37","observation_id":"129069ac-5752-435a-9e4c-0b853ec8577a","resolution":{"observed_at":"2026-08-15T16:55:00.646295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T16:55:00.649874Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.649874Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:721e1b182a235142d61be205b39ae799b83032d4068cc190c12d1ffcb7de4247","observation_id":"5006fb8b-d366-4c3b-8fb2-ad19b5083db2","resolution":{"observed_at":"2026-08-15T16:55:00.649874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.116995Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"c3917162-676b-436b-b25d-cbb0a7684929","year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.653693Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:c2cb6da141f192cb842a56809e8b4ca0b37d17bd1c480784a67ee91da8dce3a5","observation_id":"3c453831-ba0c-4fc6-9704-297907ee87b7","resolution":{"observed_at":"2026-08-15T16:55:01.120792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-15T16:55:00.656983Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.656983Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:032344d8aec5b2d35b3c14fe772af643070ea16526ad741f9153ddf7bb93af0a","observation_id":"efef8181-422e-4586-9f7d-fa6569c74dcd","resolution":{"observed_at":"2026-08-15T16:55:00.656983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07160","last_updated":"2024-06-03T03:35:01Z","snapshot_observed_at":"2026-08-17T03:01:18.530796Z","submitted_at":"2023-10-11T03:12:47Z","title":"LLark: A Multimodal Instruction-Following Language Model for Music","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07160","snapshot_observed_at":"2026-08-15T16:55:00.660561Z","title":"LLark: A multimodal foundation model for music,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.660561Z"},"links":{"cited_paper":"/paper/2310.07160","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:e72ef8506404f8fa0f32665380737b4ab78d63609d970af7e8611c49ba243aaf","observation_id":"42f46c3a-22f1-41f1-844d-f6bf23acd84a","resolution":{"observed_at":"2026-08-15T16:55:00.660561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.106782Z","title":"LP-MusicCaps: LLM-based pseudo music captioning,","venue":null,"work_id":"2b7902c4-7b95-4373-b9b8-d92a49a4642a","year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.664042Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:f3159cb7979bc29f91d9d6034a54dc7db1763ab7723dfc0b623ef32d10ff9981","observation_id":"e92829cb-bc2a-4ac6-9ba4-778ed3a070e2","resolution":{"observed_at":"2026-08-15T16:55:01.110539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.096246Z","title":"The million song dataset,","venue":null,"work_id":"50d2ab96-83ba-48a3-a73c-042906381967","year":2011},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.667291Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:092b8f85318463770378770f9e6cf9dc0610e42e30526139c525ad0cd0645dc2","observation_id":"50aa2320-a300-4898-8782-0ab956596268","resolution":{"observed_at":"2026-08-15T16:55:01.100065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T16:55:00.671094Z","title":"LLaMA 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.671094Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:3e1ef163041cd8cc75872e69338981a0eede5a53c566569b8c9d60408b7f30d4","observation_id":"d977618f-5619-4888-9e72-9b7f6641563c","resolution":{"observed_at":"2026-08-15T16:55:00.671094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-15T16:55:00.674220Z","title":"Gpteval: Nlg evaluation using gpt-4 with better human alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.674220Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:2392eb159c29cfa81d90fd261704f26b39a32186f2f6c66e09800ba1d1e36e77","observation_id":"5531cbcf-57c1-4ad0-b9fa-847cc4d1668f","resolution":{"observed_at":"2026-08-15T16:55:00.674220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15405","last_updated":"2023-10-23T23:24:57Z","snapshot_observed_at":"2026-08-16T14:49:33.000720Z","submitted_at":"2023-10-23T23:24:57Z","title":"GPT-4 as an Effective Zero-Shot Evaluator for Scientific Figure Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15405","snapshot_observed_at":"2026-08-15T16:55:00.677916Z","title":"GPT-4 as an effective zero-shot evaluator for scientific figure captions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.677916Z"},"links":{"cited_paper":"/paper/2310.15405","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:5c6a0a072a8fa0fa5900da7e15a79c728595eb7189f08cb1086f7f8513683853","observation_id":"af970079-8a50-49e8-af52-0046379447a4","resolution":{"observed_at":"2026-08-15T16:55:00.677916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02575","last_updated":"2023-08-03T12:47:17Z","snapshot_observed_at":"2026-08-17T01:18:59.586369Z","submitted_at":"2023-08-03T12:47:17Z","title":"Is GPT-4 a reliable rater? Evaluating Consistency in GPT-4 Text Ratings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02575","snapshot_observed_at":"2026-08-15T16:55:00.681892Z","title":"Is GPT-4 a reliable rater? evaluating consistency in gpt-4 text ratings,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.681892Z"},"links":{"cited_paper":"/paper/2308.02575","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:63c8915cedf56c8ff417cab83f57e9f0b368d8de74262d98bba6317fcfc34821","observation_id":"e548c8d3-f505-48f0-9597-cef2c5130f96","resolution":{"observed_at":"2026-08-15T16:55:00.681892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01910","last_updated":"2023-03-10T17:20:17Z","snapshot_observed_at":"2026-08-17T11:53:58.758448Z","submitted_at":"2022-11-03T15:43:03Z","title":"Large Language Models Are Human-Level Prompt Engineers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01910","snapshot_observed_at":"2026-08-15T16:55:00.685492Z","title":"Large language models are human-level prompt engineers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.685492Z"},"links":{"cited_paper":"/paper/2211.01910","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:8f27f30695efa238cc2b4c78b94e25bd5f565901fbf0e99e4fb8139991a54e3e","observation_id":"54974810-816b-49f2-9399-b89a999f057f","resolution":{"observed_at":"2026-08-15T16:55:00.685492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.084687Z","title":"Learning to answer questions in dynamic audio-visual scenarios,","venue":null,"work_id":"a726368e-d5cd-4466-bb79-2351cb9a65e2","year":2022},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.689040Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:18b8088f969fdbbe6621ae33689a00f6af9c775e79c11e298ff38c353860996b","observation_id":"656c485a-649a-44a5-b09c-51d442055395","resolution":{"observed_at":"2026-08-15T16:55:01.088578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11954","last_updated":"2023-10-25T13:34:13Z","snapshot_observed_at":"2026-08-16T14:51:03.986623Z","submitted_at":"2023-10-18T13:31:10Z","title":"MusicAgent: An AI Agent for Music Understanding and Generation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11954","snapshot_observed_at":"2026-08-15T16:55:00.692237Z","title":"Musicagent: An ai agent for music understanding and generation with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.692237Z"},"links":{"cited_paper":"/paper/2310.11954","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:93d87173daf9856bf91b78ad852b2b44c456c994308cf73c2091789e97e1be05","observation_id":"54eb1332-d0ec-43b7-853d-0746e6b9efe9","resolution":{"observed_at":"2026-08-15T16:55:00.692237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.073867Z","title":"Multi-level and multi-scale feature aggregation using pretrained convolutional neural networks for music auto-tagging,","venue":null,"work_id":"c81197c0-ae01-44de-9b8c-277bd651dd71","year":2017},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.696287Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:d3daad860675baac1899544adc2f056c5eb7c2c02287d62335c4f551316762e5","observation_id":"14afe033-7a0f-4226-88a7-acecc3e5ce64","resolution":{"observed_at":"2026-08-15T16:55:01.077554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.062967Z","title":"Modeling beats and downbeats with a time-frequency transformer,","venue":null,"work_id":"6737e81a-f00d-4911-b9d9-1617430f0ea8","year":2022},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.699578Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:44e34dbc802c9f3c1492f6e20ad5988267a9e0f4f0aff3deebae483676b1dd4b","observation_id":"e690701b-98e8-41f8-8bb4-19ddca150416","resolution":{"observed_at":"2026-08-15T16:55:01.067010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.052126Z","title":"SpecTNT: A time-frequency transformer for music audio,","venue":null,"work_id":"067ff8c9-81ad-45e9-9ed0-c76d5a03624f","year":2021},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.703283Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:60f3ce81bf401255bbc37c7b30febac2a9cd7c1797cc27c7fc8ce15391fb4419","observation_id":"f05d1fa9-4b76-4a75-9cb0-0c4ea9125a37","resolution":{"observed_at":"2026-08-15T16:55:01.055680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.040568Z","title":"To catch a chorus, verse, intro, or anything else: Analyzing a song with structural functions,","venue":null,"work_id":"61e0fe38-c8da-4380-8ff1-f2176fa6dd4d","year":2022},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.706806Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:25ae66331d732deaf080f51f30228f5552f8a0b005662b864aee6fbd6f966ce3","observation_id":"9403c1a8-940e-47fd-ab58-4ddc54795fd6","resolution":{"observed_at":"2026-08-15T16:55:01.044611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.029518Z","title":"Multitrack music transcription with a time-frequency perceiver,","venue":null,"work_id":"5a1765e1-c86b-4e3c-9e24-b803f858b5a4","year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.710679Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:37b3623f22ca8f57367be02b43b79afe463979f874351e0f7d4666996a0ebfb1","observation_id":"c4a321f6-e2e2-4800-83e7-b3f5fa7aba01","resolution":{"observed_at":"2026-08-15T16:55:01.033382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.018886Z","title":null,"venue":null,"work_id":"e988605a-7981-4d1f-b30a-e3513e61d0df","year":2021},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.713847Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:26ae3862be09872b1576f03ee7cd4e2a0f4f99ebe311857efa766366ecca34e8","observation_id":"2e1cef87-0924-48b2-a0e4-f079504bee16","resolution":{"observed_at":"2026-08-15T16:55:01.022465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:01.007751Z","title":"20 years of automatic chord recognition from audio,","venue":null,"work_id":"e08a6b97-3e3a-43a6-825a-701511d8ff84","year":2019},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.716843Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:3586b615fb7dd994ce6d3979364be0bf62bcf8ee5af11908743072e3874baefd","observation_id":"6e07b77f-cd16-401a-931c-8e1e0100c77d","resolution":{"observed_at":"2026-08-15T16:55:01.011627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:00.995328Z","title":"MuSFA: Improving music structural function analysis with partially labeled data,","venue":null,"work_id":"11a83322-f721-4634-877f-8891aaaf0a31","year":2022},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.720019Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:b45008f74d36ac9991473543a927138128355d65aac31d80b1ed1eb88053b898","observation_id":"4bfeb0cb-32c0-48d1-9faf-c11a4ed29d6c","resolution":{"observed_at":"2026-08-15T16:55:00.999377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-15T16:55:00.723357Z","title":"Retrieval-augmented generation for large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.723357Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:de7fa65db0dd181593787c56bd141290997d9737e54737a3c2870da6e3197f66","observation_id":"2ad78803-2d6a-4636-96b2-e959d5f5ca2a","resolution":{"observed_at":"2026-08-15T16:55:00.723357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:00.981603Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"12d70755-1da9-453b-9533-e6d4267a6f4b","year":2019},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.726981Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:465b053dcc22e5d82961bf454a9001f02d5e2647f4dc5f6b415a9206e2aaf7b8","observation_id":"e7ed74b5-709c-452f-a67c-b9860ae88b7e","resolution":{"observed_at":"2026-08-15T16:55:00.987584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:55:00.730521Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.730521Z"},"links":{"citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:b592bebab64b7c48b433aefa39dddcbe03357a0f0a16b88715094b71e701e0cf","observation_id":"3bd0454b-def0-45eb-96bb-21a58a407176","resolution":{"observed_at":"2026-08-15T16:55:00.730521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17395","last_updated":"2024-07-18T22:20:31Z","snapshot_observed_at":"2026-08-16T15:44:03.757604Z","submitted_at":"2023-03-30T14:07:47Z","title":"WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17395","snapshot_observed_at":"2026-08-15T16:55:00.733987Z","title":"WavCaps: A ChatGPT-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.733987Z"},"links":{"cited_paper":"/paper/2303.17395","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:36f1fb8e1f5c3a0abbeb1dd56ff654d4fea7249bcf9a76f66334f61cecf8dcbe","observation_id":"b9354e97-2e6c-45df-86c9-2c763a02fd2c","resolution":{"observed_at":"2026-08-15T16:55:00.733987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-17T00:33:41.369960Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-15T16:55:00.738577Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.738577Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:9de4a1f769e6361124bcfa1b1b0236fb2b34765777d8a858ab77d7dc3c678746","observation_id":"604ac2b8-eff3-40f8-b587-f5f336a97abd","resolution":{"observed_at":"2026-08-15T16:55:00.738577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T16:55:00.742512Z","title":"LoRa: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:55:00.742512Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.19514"},"observation_digest":"sha256:f5b1e3a0ea6ec71e644e837a05e3ff3d0a0662f69f5b8b5a8eae0a1b54f78690","observation_id":"dd285438-4001-4c93-9b8a-73057c6a238d","resolution":{"observed_at":"2026-08-15T16:55:00.742512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19514","last_updated":"2025-08-27T02:05:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T13:02:19.332152Z","submitted_at":"2025-08-27T02:05:27Z","title":"MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2508.19514."}