{"as_of":"2026-08-21T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ac3c4e87b8a7a6f8c7660fa43d0a3108d60751fa90b03bb74a1227cee5ae31b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:23:49.282873Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T19:35:32.952259Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-08-12T05:15:07.785245Z","title":"Muchomusic: Evaluating music understanding in multimodal audio-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00571","last_updated":"2024-12-10T10:23:54Z","snapshot_observed_at":"2026-08-16T01:01:33.190459Z","submitted_at":"2024-11-30T19:53:23Z","title":"From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview","version":2},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-08-12T05:15:07.785245Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2412.00571"},"observation_digest":"sha256:49b986befe10e8dfeb37c5c2300a8181bfd390d4935feaefe23911b5790c0022","observation_id":"e14010f1-203f-4f90-8bda-775a670a76eb","resolution":{"observed_at":"2026-08-12T05:15:07.785245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-08-11T11:09:13.491889Z","title":"Mu- chomusic: Evaluating music understanding in multimodal audio-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15838","last_updated":"2024-12-30T07:27:58Z","snapshot_observed_at":"2026-08-16T14:52:33.599355Z","submitted_at":"2024-12-20T12:27:16Z","title":"Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-11T11:09:13.491889Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2412.15838"},"observation_digest":"sha256:fd863753cabba81181e9c0fd3b14eb1db22076684c73601506b7be6fb70ae0be","observation_id":"93468098-183b-4a30-8a34-31c9cbddcaf2","resolution":{"observed_at":"2026-08-11T11:09:13.491889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-08-15T20:23:49.282873Z","title":"Muchomusic: Evaluating music under- standing in multimodal audio-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13115","last_updated":"2025-05-19T13:46:35Z","snapshot_observed_at":"2026-08-18T09:45:48.135690Z","submitted_at":"2025-05-19T13:46:35Z","title":"Benchmarking and Confidence Evaluation of LALMs For Temporal Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:23:49.282873Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2505.13115"},"observation_digest":"sha256:5af512ee0f686bba18bdd644e8628f794013ca1c42f09d9bc9b2c4d48e1b45f5","observation_id":"908d223b-5e37-44d5-898c-7db7a43f6ac7","resolution":{"observed_at":"2026-08-15T20:23:49.282873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2408.01337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-07-08T19:35:32.952259Z","title":"Yake Wei, Di Hu, Henghui Du, and Ji-Rong Wen","venue":"cs.SD","work_id":"c02d1740-6008-4174-b547-daed5cb0a69e","year":2024},"citing_paper":{"arxiv_id":"2505.20638","last_updated":"2026-04-09T22:24:30Z","snapshot_observed_at":"2026-08-20T18:05:58.021126Z","submitted_at":"2025-05-27T02:31:24Z","title":"Music Audio-Visual Question Answering Requires Specialized Multimodal Designs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T14:11:52.011626Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2505.20638"},"observation_digest":"sha256:c4c47a38b2b2a7669836ea7d97af08b37e316c0c10868ab090a6b320f5e3dd5d","observation_id":"f254073d-a561-4fe9-9aac-1df1e57fed69","resolution":{"observed_at":"2026-05-19T14:12:22.024856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-08-07T11:29:00.052781Z","title":"Muchomusic: Evaluating music understanding in multimodal audio-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-13T12:54:08.987275Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":145,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:00.052781Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:84936dd272c3dec7ce6d40782efd696305c904bcc6ec5eedeee27e54bc9b117b","observation_id":"07e61905-a2e2-4d61-9fec-6569908441fa","resolution":{"observed_at":"2026-08-07T11:29:00.052781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2408.01337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-07-08T19:35:32.952259Z","title":"Yake Wei, Di Hu, Henghui Du, and Ji-Rong Wen","venue":"cs.SD","work_id":"c02d1740-6008-4174-b547-daed5cb0a69e","year":2024},"citing_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-08-17T22:20:20.496099Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-05-15T03:42:44.523919Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2507.08128"},"observation_digest":"sha256:2c6b24cc4d4dd4d1b47c50b283900060f99082b55ab5126f76c5e72294d22fa5","observation_id":"1f3baa0f-5bc1-405c-9df1-c3e2106b41fa","resolution":{"observed_at":"2026-05-15T03:42:45.271465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2408.01337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-07-08T19:35:32.952259Z","title":"Yake Wei, Di Hu, Henghui Du, and Ji-Rong Wen","venue":"cs.SD","work_id":"c02d1740-6008-4174-b547-daed5cb0a69e","year":2024},"citing_paper":{"arxiv_id":"2604.16502","last_updated":"2026-06-04T06:39:21Z","snapshot_observed_at":"2026-08-11T15:51:14.054052Z","submitted_at":"2026-04-14T14:36:53Z","title":"Topology-Aware Layer Pruning for Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:21:04.009413Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2604.16502"},"observation_digest":"sha256:29b840e95a67a0fd82df9ebe540d4730fe71adec981e20bcce839c88a7fc8ad9","observation_id":"d6e8ad95-9497-4d22-af54-95c16feefb10","resolution":{"observed_at":"2026-05-11T09:00:59.448862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2408.01337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-07-08T19:35:32.952259Z","title":"Yake Wei, Di Hu, Henghui Du, and Ji-Rong Wen","venue":"cs.SD","work_id":"c02d1740-6008-4174-b547-daed5cb0a69e","year":2024},"citing_paper":{"arxiv_id":"2605.29300","last_updated":"2026-05-28T03:28:16Z","snapshot_observed_at":"2026-08-08T02:06:28.843197Z","submitted_at":"2026-05-28T03:28:16Z","title":"MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T07:58:51.272971Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2605.29300"},"observation_digest":"sha256:a2612659dbaf0c408cc00571543064b0a10f2c91d7aa0e356ad2f3d8767a72e6","observation_id":"3efb89ea-0c58-4d6a-92bf-91e25f9035ad","resolution":{"observed_at":"2026-06-29T08:03:14.338604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2408.01337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-07-08T19:35:32.952259Z","title":"Yake Wei, Di Hu, Henghui Du, and Ji-Rong Wen","venue":"cs.SD","work_id":"c02d1740-6008-4174-b547-daed5cb0a69e","year":2024},"citing_paper":{"arxiv_id":"2606.31338","last_updated":"2026-06-30T08:39:56Z","snapshot_observed_at":"2026-08-15T11:38:24.936264Z","submitted_at":"2026-06-30T08:39:56Z","title":"Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T03:31:42.611472Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2606.31338"},"observation_digest":"sha256:cb553f1f7a16e45e6ee2600878f82f7de8276e3958e6da44eea4be744e107431","observation_id":"cb3364aa-a6dc-4f9b-aae3-bfbb1ba07bcf","resolution":{"observed_at":"2026-07-01T11:55:43.020881Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2408.01337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01337","snapshot_observed_at":"2026-07-08T19:35:32.952259Z","title":"Yake Wei, Di Hu, Henghui Du, and Ji-Rong Wen","venue":"cs.SD","work_id":"c02d1740-6008-4174-b547-daed5cb0a69e","year":2024},"citing_paper":{"arxiv_id":"2607.06015","last_updated":"2026-07-07T08:57:34Z","snapshot_observed_at":"2026-08-18T01:53:38.537475Z","submitted_at":"2026-07-07T08:57:34Z","title":"Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T19:28:58.523932Z"},"links":{"cited_paper":"/paper/2408.01337","citing_paper":"/paper/2607.06015"},"observation_digest":"sha256:86d95085388bbce9b0c5cad01f2b03644ffb21ab2b65f9f996101344ce108c61","observation_id":"147d1cc8-2bf6-49f5-89c7-fe0bd61e0003","resolution":{"observed_at":"2026-07-08T19:35:32.954819Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2408.01337/citation-record","integrity":"/paper/2408.01337/integrity","json":"/paper/2408.01337/citation-record.json","paper":"/paper/2408.01337"},"outbound":[],"paper":{"arxiv_id":"2408.01337","last_updated":"2024-08-02T15:34:05Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T13:28:56.012301Z","submitted_at":"2024-08-02T15:34:05Z","title":"MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2408.01337."}