{"as_of":"2026-08-09T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c65546ecc17a0d67d01d1657579095929cb711e1dcaddcbf7f6efa453cde5e0d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:49:44.099128Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-07T00:49:44.099128Z","title":"Mumu-llama: Multi-modal music understanding and generation via large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-08T11:30:56.714691Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:44.099128Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:9f556a69a8e7985afc80723c9a18d03957429e9fd12d74c20ff0070a46f5fd1f","observation_id":"29b928b4-861d-4832-8757-7750994f7a18","resolution":{"observed_at":"2026-08-07T00:49:44.099128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-05T14:08:49.450762Z","title":"Mumu-llama: Multi-modal music understanding and generation via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00132","last_updated":"2025-08-29T14:15:12Z","snapshot_observed_at":"2026-08-05T14:08:47.379281Z","submitted_at":"2025-08-29T14:15:12Z","title":"CoComposer: LLM Multi-agent Collaborative Music Composition","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T14:08:49.450762Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2509.00132"},"observation_digest":"sha256:21ce625c678ddeacead3fab4f3256e91c0f618d08c153cd52ba29e4820a457fd","observation_id":"e0a56444-c904-473d-bc8c-293cddf235e7","resolution":{"observed_at":"2026-08-05T14:08:49.450762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-04T17:01:26.252375Z","title":"Mumu-llama: Multi-modal music understanding and generation via large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11183","last_updated":"2025-09-14T09:29:33Z","snapshot_observed_at":"2026-08-04T17:01:25.984573Z","submitted_at":"2025-09-14T09:29:33Z","title":"WeaveMuse: An Open Agentic System for Multimodal Music Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:26.252375Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2509.11183"},"observation_digest":"sha256:a8809dc5d7bb7f3404b924dbc313163c7b26011a263633e602389827b025462b","observation_id":"e22d0eea-1baa-4009-9178-c7d91576540d","resolution":{"observed_at":"2026-08-04T17:01:26.252375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.06660","doi":"10.48550/arxiv.2412.06660","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mumu-llama: Multi- modal music understanding and generation via large language models","venue":"arXiv (Cornell University)","work_id":"86e76775-33a2-445b-ab0d-a80ea3058812","year":2024},"citing_paper":{"arxiv_id":"2509.22378","last_updated":"2026-04-16T08:15:21Z","snapshot_observed_at":"2026-08-03T13:59:15.066089Z","submitted_at":"2025-09-26T14:07:29Z","title":"Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T12:39:56.396231Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2509.22378"},"observation_digest":"sha256:c7b054d481d3fb77707a2f39d2df76a3633ba7484627b0e90060974f4b718267","observation_id":"15dfa6d9-63a3-407b-b1a1-ef073fbfabcc","resolution":{"observed_at":"2026-05-18T12:41:22.691207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-04T00:29:46.845901Z","title":"Mumu-llama: Multi-modal music understanding and generation via large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05550","last_updated":"2026-05-26T23:40:49Z","snapshot_observed_at":"2026-08-05T14:57:28.629677Z","submitted_at":"2025-11-02T18:08:26Z","title":"Assessing Factual Music Comprehension in Large Audio Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T00:29:46.845901Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2511.05550"},"observation_digest":"sha256:1667f8423309113109c29beb7767c918e18b221d4f99e12030328a62185af0be","observation_id":"7c7d4301-72d4-4c73-8a61-293e4a56bae5","resolution":{"observed_at":"2026-08-04T00:29:46.845901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.06660","doi":"10.48550/arxiv.2412.06660","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mumu-llama: Multi- modal music understanding and generation via large language models","venue":"arXiv (Cornell University)","work_id":"86e76775-33a2-445b-ab0d-a80ea3058812","year":2024},"citing_paper":{"arxiv_id":"2605.29300","last_updated":"2026-05-28T03:28:16Z","snapshot_observed_at":"2026-08-08T02:06:28.843197Z","submitted_at":"2026-05-28T03:28:16Z","title":"MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T07:58:51.272971Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2605.29300"},"observation_digest":"sha256:fb00b57999312dae62837ed724a2d2115528b9696b55591939529bfb25b28b91","observation_id":"cb1a608a-ac30-449e-8508-c744c0187524","resolution":{"observed_at":"2026-06-29T08:03:14.327192Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.06660","doi":"10.48550/arxiv.2412.06660","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mumu-llama: Multi- modal music understanding and generation via large language models","venue":"arXiv (Cornell University)","work_id":"86e76775-33a2-445b-ab0d-a80ea3058812","year":2024},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:64a2eac5a8efc881b3136ad8c74c26af5570857b454aab298960bb8ce3ab1647","observation_id":"6f86704a-5c1a-4950-9d1b-daabb4d47bc4","resolution":{"observed_at":"2026-07-02T00:56:24.675619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.06660","doi":"10.48550/arxiv.2412.06660","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mumu-llama: Multi- modal music understanding and generation via large language models","venue":"arXiv (Cornell University)","work_id":"86e76775-33a2-445b-ab0d-a80ea3058812","year":2024},"citing_paper":{"arxiv_id":"2606.02739","last_updated":"2026-06-01T18:05:18Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T18:05:18Z","title":"EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T12:34:06.024192Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2606.02739"},"observation_digest":"sha256:46d6cf4c5c36b678ddc5755ace959a4cacbd14f6d34f5d20819795d0e49b24db","observation_id":"fb1dc0a5-c76d-40de-b689-6b9ebc421660","resolution":{"observed_at":"2026-06-28T12:42:08.960299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.06660","doi":"10.48550/arxiv.2412.06660","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mumu-llama: Multi- modal music understanding and generation via large language models","venue":"arXiv (Cornell University)","work_id":"86e76775-33a2-445b-ab0d-a80ea3058812","year":2024},"citing_paper":{"arxiv_id":"2606.12555","last_updated":"2026-07-02T19:10:03Z","snapshot_observed_at":"2026-07-12T14:16:32.755376Z","submitted_at":"2026-06-10T18:06:27Z","title":"AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T08:04:48.283908Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2606.12555"},"observation_digest":"sha256:42eb4f63617162389209cdc2116b9afe2b377a44a146d4a86a3aae82de092471","observation_id":"f9ce5774-f600-457c-93c2-fc45393e91ee","resolution":{"observed_at":"2026-07-03T13:28:18.767747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06660","snapshot_observed_at":"2026-08-03T01:28:27.544162Z","title":"2412.06660 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28896","last_updated":"2026-07-30T23:28:11Z","snapshot_observed_at":"2026-08-08T00:26:01.747407Z","submitted_at":"2026-07-30T23:28:11Z","title":"TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T01:28:27.544162Z"},"links":{"cited_paper":"/paper/2412.06660","citing_paper":"/paper/2607.28896"},"observation_digest":"sha256:5b42d11a458bb817b8f9c50358de27896aaae5e199c9fa249e871b307a33124f","observation_id":"4bb19c6a-ee30-4b9a-9400-4353f2b0f2dd","resolution":{"observed_at":"2026-08-03T01:28:27.544162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06660/citation-record","integrity":"/paper/2412.06660/integrity","json":"/paper/2412.06660/citation-record.json","paper":"/paper/2412.06660"},"outbound":[],"paper":{"arxiv_id":"2412.06660","last_updated":"2024-12-09T16:59:35Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-03T13:30:52.953694Z","submitted_at":"2024-12-09T16:59:35Z","title":"MuMu-LLaMA: Multi-modal Music Understanding and Generation via Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2412.06660."}