{"as_of":"2026-08-08T21:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b922726febe4c764fc67b0950699aae5b1356dd4bece1b98af7c29a1b216b4b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:54:22.907977Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:47:06.209809Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-07T05:36:43.104009Z","title":"Y., and Ellis, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07473","last_updated":"2026-07-14T14:48:02Z","snapshot_observed_at":"2026-08-07T05:30:32.366338Z","submitted_at":"2025-06-09T06:47:26Z","title":"An introduction to pitch strength in contemporary popular music analysis and production","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:36:43.104009Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2506.07473"},"observation_digest":"sha256:07d6edeb31bfd19db30d95d20717e1138c329ad6c531d0e935da44f517eec876","observation_id":"c1290719-249f-4986-bb8b-b4d6ba2eabe9","resolution":{"observed_at":"2026-08-07T05:36:43.104009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-07T00:59:53.301995Z","title":"Mulan: A joint embedding of music audio and natural language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12285","last_updated":"2025-06-27T22:42:09Z","snapshot_observed_at":"2026-08-07T00:51:11.140669Z","submitted_at":"2025-06-14T00:18:44Z","title":"CMI-Bench: A Comprehensive Benchmark for Evaluating Music Instruction Following","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:53.301995Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2506.12285"},"observation_digest":"sha256:aa20d635115e274c14736f9fe3a6ea7a4635cd7607fe300b76b1ab8b7ef81503","observation_id":"208e4dfc-25bf-4969-9ca7-b30bbad69288","resolution":{"observed_at":"2026-08-07T00:59:53.301995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-06T21:36:16.292351Z","title":"Mulan: A joint embedding of music audio and natural language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23869","last_updated":"2025-06-30T14:00:14Z","snapshot_observed_at":"2026-08-07T12:41:43.292333Z","submitted_at":"2025-06-30T14:00:14Z","title":"Scaling Self-Supervised Representation Learning for Symbolic Piano Performance","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:16.292351Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2506.23869"},"observation_digest":"sha256:4ee4dc2a626d7c40b7f7661f7ec2a9012a9ac6ddc78458d3497d891e6a4ecda6","observation_id":"042c3dd8-b624-4796-8de9-02b16caf19cb","resolution":{"observed_at":"2026-08-06T21:36:16.292351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-06T16:40:49.324430Z","title":"Mulan: A joint embedding of music audio and natural language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12890","last_updated":"2025-07-24T08:15:02Z","snapshot_observed_at":"2026-08-08T03:25:27.344834Z","submitted_at":"2025-07-17T08:18:55Z","title":"DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:40:49.324430Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2507.12890"},"observation_digest":"sha256:a30f48fb29f0080528e9d664482a61f6e59140112e51b4fbc9083965981bb0bc","observation_id":"36b63466-0a07-400e-9b86-569e022fa58e","resolution":{"observed_at":"2026-08-06T16:40:49.324430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-05T10:21:54.216932Z","title":"Mulan: A joint embedding of music audio and natural language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-05T10:21:53.850876Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.216932Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:a8453dd9d9b57f1b12fdd22d23bb3ac3713433855b092fca3acafd22f208ef81","observation_id":"a4784200-4947-4cd9-b1c1-29d31da4a85d","resolution":{"observed_at":"2026-08-05T10:21:54.216932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":"2208.12415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-07-02T15:47:06.209809Z","title":"https://doi.org/10","venue":null,"work_id":"fc1b5098-3024-4461-ac7f-d30d13693470","year":1990},"citing_paper":{"arxiv_id":"2603.03190","last_updated":"2026-05-18T03:37:10Z","snapshot_observed_at":"2026-07-06T22:47:41.997192Z","submitted_at":"2026-03-03T17:47:09Z","title":"Expectation and Acoustic Neural Network Representations Enhance Music Identification from Brain Activity","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T11:36:06.967549Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2603.03190"},"observation_digest":"sha256:3fda79678940f75713d8583b0a57d998df4885606fa085765a193688ce5bc8c2","observation_id":"90371326-2b88-4523-a120-6df04801184f","resolution":{"observed_at":"2026-05-21T11:40:03.509778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":"2208.12415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-07-02T15:47:06.209809Z","title":"https://doi.org/10","venue":null,"work_id":"fc1b5098-3024-4461-ac7f-d30d13693470","year":1990},"citing_paper":{"arxiv_id":"2605.00824","last_updated":"2026-05-01T17:59:50Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:59:50Z","title":"CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T14:51:16.918157Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2605.00824"},"observation_digest":"sha256:efd982c0a328fd0452c83a87b64000bb314dab2d434559e558cf09ad4879b08e","observation_id":"e2b7dfc0-64be-4d15-9608-e93b85d0d60e","resolution":{"observed_at":"2026-05-11T16:51:06.850643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":"2208.12415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-07-02T15:47:06.209809Z","title":"https://doi.org/10","venue":null,"work_id":"fc1b5098-3024-4461-ac7f-d30d13693470","year":1990},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T12:25:52.847432Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:83ec8d83e5512db5008f7abc720079c6d8467a14e52fc4e33a16b0e1d9298e23","observation_id":"f47275b6-6b8a-499e-a8c7-cf98ee7c0849","resolution":{"observed_at":"2026-05-11T19:16:08.767388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":"2208.12415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-07-02T15:47:06.209809Z","title":"https://doi.org/10","venue":null,"work_id":"fc1b5098-3024-4461-ac7f-d30d13693470","year":1990},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T23:14:32.494076Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:3afde09e40f62c2cd3303b23d33b19a219f719ef3324bac8afbc131123f5428d","observation_id":"bdb6a208-3b53-4369-92bc-db3c7e9550d7","resolution":{"observed_at":"2026-06-30T23:15:07.850673Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":"2208.12415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-07-02T15:47:06.209809Z","title":"https://doi.org/10","venue":null,"work_id":"fc1b5098-3024-4461-ac7f-d30d13693470","year":1990},"citing_paper":{"arxiv_id":"2605.21081","last_updated":"2026-05-20T12:16:28Z","snapshot_observed_at":"2026-08-06T01:21:51.969876Z","submitted_at":"2026-05-20T12:16:28Z","title":"Musical Attention Transformer: Music Generation Using a Music-Specific Attention Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T01:44:20.282896Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2605.21081"},"observation_digest":"sha256:9b4e56d0944b2203fef132c6479101f27f1230806ccdf81b1d300dd4b86dc982","observation_id":"fb3376ef-1a5c-438b-ae7f-8cd01904bce3","resolution":{"observed_at":"2026-05-21T01:44:22.712237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":"2208.12415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-07-02T15:47:06.209809Z","title":"https://doi.org/10","venue":null,"work_id":"fc1b5098-3024-4461-ac7f-d30d13693470","year":1990},"citing_paper":{"arxiv_id":"2605.27346","last_updated":"2026-05-26T17:49:18Z","snapshot_observed_at":"2026-08-07T04:13:52.635292Z","submitted_at":"2026-05-26T17:49:18Z","title":"MERIT: Learning Disentangled Music Representations for Audio Similarity","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T15:40:57.719214Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2605.27346"},"observation_digest":"sha256:296baf54b50cd2846a9ba9337988e038a1a4f96c69f7b9f4c88f8ac0a2bd6583","observation_id":"f13f9ee2-56da-4ea2-bada-b5b0c1b782e5","resolution":{"observed_at":"2026-06-29T15:43:32.553133Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":"2208.12415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-07-02T15:47:06.209809Z","title":"https://doi.org/10","venue":null,"work_id":"fc1b5098-3024-4461-ac7f-d30d13693470","year":1990},"citing_paper":{"arxiv_id":"2606.03169","last_updated":"2026-06-02T05:27:56Z","snapshot_observed_at":"2026-08-07T13:59:58.115351Z","submitted_at":"2026-06-02T05:27:56Z","title":"SketchSong: Hierarchical Song Generation with Sketch Planning and Fine-Grained Multi-Track Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T08:53:17.009342Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2606.03169"},"observation_digest":"sha256:e9e659a1e0006e763e71697325c99f77b94692842de9cf5a2f97eac598d44c4b","observation_id":"7a1ea906-89b6-4db6-81a8-c2c9f27944a2","resolution":{"observed_at":"2026-07-02T04:46:38.022078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":"2208.12415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-07-02T15:47:06.209809Z","title":"https://doi.org/10","venue":null,"work_id":"fc1b5098-3024-4461-ac7f-d30d13693470","year":1990},"citing_paper":{"arxiv_id":"2606.06615","last_updated":"2026-06-04T18:05:39Z","snapshot_observed_at":"2026-08-02T17:34:11.164458Z","submitted_at":"2026-06-04T18:05:39Z","title":"FIGMA: Towards FIne-Grained Music retrievAl","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T23:32:09.401023Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2606.06615"},"observation_digest":"sha256:ffe9e333ae0b6f12d4b8ff4a6b023a48fe31a5c2ab4f758bfde432645a99c960","observation_id":"d7d21625-9f67-40e0-adef-03cdb5a713de","resolution":{"observed_at":"2026-07-02T15:47:06.211145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-07-14T06:45:43.330341Z","title":"Mulan: A joint embedding of music audio and natural language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T06:45:43.330341Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:6e4b86820df4d1940e226912431cc98e8e6bb1b92b9f39acd5a2728c996a9676","observation_id":"8315dcc1-864c-4feb-82bc-24b654613d1f","resolution":{"observed_at":"2026-07-14T06:45:43.330341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-02T07:05:05.133233Z","title":"Mulan: A joint embedding of music audio and natural language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T07:05:05.133233Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:c9a022a9a8ac860dd7c8d65dabbd5cf81d0ffa6394f5bca749495f3a80f1e3e7","observation_id":"5e472183-eca2-4d69-b17c-ae624a4b90de","resolution":{"observed_at":"2026-08-02T07:05:05.133233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-08T17:54:22.907977Z","title":"Hung, H.-T.; Ching, J.; Doh, S.; Kim, N.; Nam, J.; and Yang, Y .-H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05222","last_updated":"2026-08-05T11:03:33Z","snapshot_observed_at":"2026-08-08T21:13:58.634722Z","submitted_at":"2026-08-05T11:03:33Z","title":"Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T17:54:22.907977Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2608.05222"},"observation_digest":"sha256:ce202f18b272783251f592daae082d3e25fc67ddf89191c99bcee91d51831c3a","observation_id":"4f81140f-afe0-49b6-8345-0031d08cab2b","resolution":{"observed_at":"2026-08-08T17:54:22.907977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2208.12415/citation-record","integrity":"/paper/2208.12415/integrity","json":"/paper/2208.12415/citation-record.json","paper":"/paper/2208.12415"},"outbound":[],"paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T13:45:38.605248Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2208.12415."}