{"as_of":"2026-08-08T23:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7fb9fc8b59ee0f21dbb10374a3aafc314781e45d173e50c19cf683ea85155c96","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:10.142767Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12996/citation-record","integrity":"/paper/2507.12996/integrity","json":"/paper/2507.12996/citation-record.json","paper":"/paper/2507.12996"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.12210","last_updated":"2023-06-28T14:15:22Z","snapshot_observed_at":"2026-07-06T15:19:24.263225Z","submitted_at":"2023-04-24T15:49:53Z","title":"A Cookbook of Self-Supervised Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12210","snapshot_observed_at":"2026-08-06T16:39:06.123576Z","title":"A cookbook of self- supervised learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.123576Z"},"links":{"cited_paper":"/paper/2304.12210","citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:a599fdbd55fae221509fb64d47a10f67475d7769cbbf2b9aa0911992db6be14c","observation_id":"2fe4a21a-d2ed-4511-b347-6180486e21f9","resolution":{"observed_at":"2026-08-06T16:39:06.123576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:19.509418Z","title":"An experimental comparison of multi-view self-supervised methods for music tagging,","venue":null,"work_id":"a1251f6c-ea51-41eb-9b06-b0eca778c04a","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.198285Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:dff244e206ecc15b5c3730103b8e6843256d852fe11304f309c92f2e36664846","observation_id":"1ee98ac7-333b-4727-a5aa-9f4f98148951","resolution":{"observed_at":"2026-08-06T16:39:19.650436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:19.339320Z","title":"Contrastive learning of musical representations,","venue":null,"work_id":"14421583-8fe6-413a-b296-d35441965ad4","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.275515Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:57eb42627e3248984597a2c81c8631e0f8c2c85927603503ae86284047cd6cf5","observation_id":"e13b67f7-4a86-4eb2-a04f-96cbe17a23e0","resolution":{"observed_at":"2026-08-06T16:39:19.413237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:19.147155Z","title":"Supervised and unsupervised learning of audio representations for music understanding,","venue":null,"work_id":"cd094124-6f28-4086-8f41-1dbab65f7a95","year":2022},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.391504Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:e5d974939c1ab9b4083ba9c9022df0c597184b5e2543e13a44dc12efec6ea497","observation_id":"ed5517f9-3ed9-4668-afbf-a4cbb9badf4c","resolution":{"observed_at":"2026-08-06T16:39:19.239335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:18.838474Z","title":"Leave-one-equivariant: Allevi- ating invariance-related information loss in contrastive music represen- tations,","venue":null,"work_id":"6f4a0dc8-d524-4ec0-90c0-2e864885e006","year":2025},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.491071Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:05a8c524ee3add27aa1263cfa70706e765080c7e627f480bbc43ba4092e5b152","observation_id":"fcd90180-0da5-4409-a693-4887cfadda05","resolution":{"observed_at":"2026-08-06T16:39:18.938611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:18.471646Z","title":"Towards proper contrastive self- supervised learning strategies for music audio representation,","venue":null,"work_id":"0540ad3d-d6b9-4407-9818-ba8a809dc517","year":2022},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.584398Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:62842e385bf83feaee963f833a6ec56baed9c7f8ec33bdad7fea2c8d4c60816c","observation_id":"3dfbb3a2-b9fe-4033-8fc7-f782a4619db3","resolution":{"observed_at":"2026-08-06T16:39:18.636505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:18.271169Z","title":null,"venue":null,"work_id":"464f509a-3db6-447a-8907-8029869c5cdd","year":2010},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.710962Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:4d43a15c91288c1133af7d40e434bd70e81fbb8507d7db53bc62c1e8976de228","observation_id":"5fd0c5d4-e01e-4c2b-9765-7941f7866e88","resolution":{"observed_at":"2026-08-06T16:39:18.354315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:18.031588Z","title":"Zero-note samba: Self- supervised beat tracking,","venue":null,"work_id":"f9bd5b22-235d-4332-b683-6f68e5652eac","year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.783107Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:70883071a8569bb05c07bdff7720c5dac75ce01628fba4173bb65ba35880ca6b","observation_id":"817544f3-d3cd-4c4f-a7e9-13ce2ef38eea","resolution":{"observed_at":"2026-08-06T16:39:18.176209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:17.761686Z","title":"SPICE: Self-supervised pitch estimation,","venue":null,"work_id":"0cdfd9dd-3b88-4f86-91e6-155d4bed7a48","year":2020},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.851571Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:8d92482f01e8036f83103f6b1c9bfb785eddbd9ae9f3a5976783ee343b5cb39e","observation_id":"7e74a78d-730c-4ea1-8ea6-1c1f69105a7b","resolution":{"observed_at":"2026-08-06T16:39:17.910210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:17.469216Z","title":"PESTO: Pitch estimation with self-supervised transposition-equivariant objective,","venue":null,"work_id":"ab1d4ee3-81fb-42c7-927e-494150e61352","year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.947186Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:3d70b6f2a7f2887655d74385b3063da80f64fdf123b6d145a23f0bbe2d41e601","observation_id":"09c6c241-01e9-47cd-8d0f-1e822d11e6d5","resolution":{"observed_at":"2026-08-06T16:39:17.612435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:17.202037Z","title":"Equivariant self-supervision for musical tempo estimation,","venue":null,"work_id":"387a0cc6-bd8d-4096-a753-541b952a90d3","year":2022},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.024991Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:7742cb8648f2f9d1e30ae7a4021b12d13c0b1a6c17be561c363bf580a4dbe23e","observation_id":"56ea1556-9f84-490c-a75b-996df1cba6df","resolution":{"observed_at":"2026-08-06T16:39:17.343428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:16.934737Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training,","venue":null,"work_id":"edac9a7f-831b-472b-a481-391f37b20270","year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.147424Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:dad226ce5803f16180a7dc464cfa54c1dc36a320b388a0e82e02beb3162c58d1","observation_id":"3be5322f-8508-49cc-80a8-0f821c6cdaee","resolution":{"observed_at":"2026-08-06T16:39:17.052103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:16.720138Z","title":"A foundation model for music informatics,","venue":null,"work_id":"94f91c2d-bb44-4d92-88a9-9cb6c2c097ff","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.229386Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:186cd1a148b7a3a2004dd4b53eaa8f11cc8e08e1749e976cbe43cfb8e27cfb9e","observation_id":"959c7398-da7a-4178-a5e1-bd55996d9723","resolution":{"observed_at":"2026-08-06T16:39:16.844938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:16.419633Z","title":"Multi-tasking with joint semantic spaces for large-scale music annotation and retrieval,","venue":null,"work_id":"d5cba502-3a66-44ae-9e8b-83af4758195c","year":2011},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.349970Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:2f49954d93eed45ee6885af03afdb70149fee15a800340ccead8267ec55f697b","observation_id":"29b309fb-390b-432c-b0c2-006db51e2935","resolution":{"observed_at":"2026-08-06T16:39:16.574363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:16.087587Z","title":"Transfer learning in MIR: Sharing learned latent representations for music audio classification and similarity,","venue":null,"work_id":"d2fcfbe9-511b-4b2b-9535-9c4b0f27f459","year":2013},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.477417Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:28d745e8db073b70638e457a058a7bc850de0555b0dfa814b104afb68d116296","observation_id":"9f94d96d-1757-496a-bd8c-780f2ac0430d","resolution":{"observed_at":"2026-08-06T16:39:16.272406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:15.757810Z","title":"The MIREX grand challenge: A framework of holistic user-experience evaluation in music information retrieval,","venue":null,"work_id":"400384be-d4ba-4752-8242-226dc8dc663c","year":2014},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.586303Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:b88b8213406135ea0f5e0f3797df8cb9a17f82bf5db4f5725d0a96829b9e6767","observation_id":"e2e13f93-62ba-4501-98e1-d96453e75fd9","resolution":{"observed_at":"2026-08-06T16:39:15.915095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:15.483059Z","title":"Cross task study on MIREX recent results: An index for evolution measurement and some stagnation hypotheses,","venue":null,"work_id":"abdad610-b70d-4252-bb77-7360da3267b6","year":2016},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.751761Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:0f3d93dc356e535ae540ae2aa299a9c4e1046d907532b604407ccce7553f1dfd","observation_id":"8e2486d3-80ae-4ce1-b854-77a97fa9d150","resolution":{"observed_at":"2026-08-06T16:39:15.607290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:15.161577Z","title":"Multitask learning for frame- level instrument recognition,","venue":null,"work_id":"7eaf6e10-28bd-4e5f-aa70-177410831472","year":2019},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.815949Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:7f7390c84cc860a80bea4c4adb756eeec30c5c1dbaa23a78cbb38a4f7545c282","observation_id":"eb62518d-20b7-4422-a59b-b9f9a643f818","resolution":{"observed_at":"2026-08-06T16:39:15.329771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:14.941211Z","title":"One deep music representation to rule them all? a comparative analysis of different representation learning strategies,","venue":null,"work_id":"6d53a1e2-d368-43b2-be1d-3e46150245c4","year":2020},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.923063Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:8e4325753b6d43445810f116629a1135c89a10b8d0c1ac931e7e923c856e3dd6","observation_id":"12e353a7-e3ef-4815-a55f-65ef60644bcd","resolution":{"observed_at":"2026-08-06T16:39:15.050061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:14.636341Z","title":"Multitask learning based deep learning model for music artist and language recognition,","venue":null,"work_id":"f7f20677-f1d5-402e-98f6-1e2663e28e5e","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.054398Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:303ba0c97f5609bf4512afdccedc5ad99f08de130b63ab6c65fea05158c9b5de","observation_id":"745be124-e777-413c-a87c-bc7f389cb750","resolution":{"observed_at":"2026-08-06T16:39:14.824319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:14.337839Z","title":"HEAR: Holistic evaluation of audio representations,","venue":null,"work_id":"596e2f06-550f-4074-931c-d0364d3d5e8f","year":2022},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.140316Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:4fafd62c406dcbdd17e98bd83399b652b5cfaa454a5320c3fb622ef64753bbce","observation_id":"1c2404bd-3689-4e68-89cb-c4a661c7170e","resolution":{"observed_at":"2026-08-06T16:39:14.508969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:14.063413Z","title":"Emergent musical properties of a transformer under contrastive self-supervised learning,","venue":null,"work_id":"59fc1d47-9a69-4170-a0e6-9df478449e82","year":2025},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.247736Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:c9195089e754217d4223940318214595875a41bba91ca2d22044ad94a3ba14ad","observation_id":"e028789e-7348-48ce-82f8-4c0689b8f49b","resolution":{"observed_at":"2026-08-06T16:39:14.186329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:13.755415Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"ff181329-2816-42e9-9802-d3a4a0fc01af","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.357150Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:1f56e4eedc207279c3e38c39b82de5b83eaee75873ee7d435bdc422e8584c052","observation_id":"1685e77c-5974-4797-9f91-a096ec2d2d0d","resolution":{"observed_at":"2026-08-06T16:39:13.941756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:13.478968Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":"0ef4eaca-d8a7-4067-a1f7-25325ed56b89","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.431114Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:0f7607b603539eda9fe0e2de7b24ce50292aa314ee5c16d2cb9f31f21972b7ea","observation_id":"ea1a4756-c765-4d4c-bfa4-31cdf48cbc7a","resolution":{"observed_at":"2026-08-06T16:39:13.625911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:13.198215Z","title":"STONE: Self-supervised tonality estimator,","venue":null,"work_id":"c63c034d-a8ed-4b52-b9a9-92777ff9be28","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.550193Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:c0d7894438377756c7968d946e8822e7d0dc0effacffabdbf7f3838a3858c9d8","observation_id":"bd96e717-5916-42f3-a894-56617d7ff849","resolution":{"observed_at":"2026-08-06T16:39:13.356380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.969948Z","title":"S-key: Self-supervised learning of major and minor keys from audio,","venue":null,"work_id":"8895c4ea-990b-4967-b7fe-2af010d933b3","year":2025},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.628087Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:eb69fb5aa3e8d3af4c7b3031f173672a8b110b62ddca38ef04dfadb98194b933","observation_id":"e815fed8-6ac9-4947-9683-92e8dd26e1f5","resolution":{"observed_at":"2026-08-06T16:39:13.093929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.738369Z","title":"Deep salience representations for f0 estimation in polyphonic music,","venue":null,"work_id":"e879265a-acdf-4bc9-a151-527422e50e8a","year":2017},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.691067Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:43cd393b0a29cbe7893aa8623c281c25ad2ebcea384524d287269dfa46e9b2b4","observation_id":"a099fb61-c4ca-4198-afbe-78be05eb6c7f","resolution":{"observed_at":"2026-08-06T16:39:12.827193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.429510Z","title":"Vision transformers need registers,","venue":null,"work_id":"dc7dcaf1-efa9-49ae-88ac-18250a204d36","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.763168Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:3e591c390bd591e776b35ec2190d16960c020d1cf00270153679f58fcb8340db","observation_id":"c5c43fd0-dff6-493f-8297-487a47c10a58","resolution":{"observed_at":"2026-08-06T16:39:12.561961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.251333Z","title":"Mctformer+: Multi-class token transformer for weakly supervised semantic segmentation,","venue":null,"work_id":"ccb6c97c-d58a-44e0-bf6c-8f51e64a89ec","year":2024},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.931222Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:d652947eaf2c1ecaee643bb6b6f5d638feb3ed55aae63a005ca4160952ec3a00","observation_id":"b2fd8ca1-0eed-465d-b40d-41e0b6c0a942","resolution":{"observed_at":"2026-08-06T16:39:12.363612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:12.052762Z","title":"Evaluation of algorithms using games: The case of music tagging,","venue":null,"work_id":"c3ef3211-c6bd-4a62-86c9-a084f79805bb","year":2009},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:08.997241Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:04a0e77b6c929985234d25c31f6c6568e7829aa5517564e44119b6f8183916d3","observation_id":"dae52f66-3bbf-4969-9109-d82c9d64f4c4","resolution":{"observed_at":"2026-08-06T16:39:12.136057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.884240Z","title":"Sample-level deep convolutional neural networks for music auto-tagging using raw waveforms,","venue":null,"work_id":"000b6cb4-7b1d-49a7-ad72-ddffb7b2c9fc","year":2017},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.178222Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:daecb37ccfcfad00f7dd23231b5a1f1403d5c90ff301f87c30c95627acee887f","observation_id":"b5fc4ea1-4f27-421f-8e31-320df4670369","resolution":{"observed_at":"2026-08-06T16:39:11.948872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.745267Z","title":"Orchideasol: A dataset of extended instrumental techniques for computer- aided orchestration,","venue":null,"work_id":"604c6a3b-b6f5-4f92-a3b9-e7f6a05066bd","year":2020},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.268759Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:fd53040cda4df277d0131a3967c2e2793a01c44327548d3e574fe75c1f95bd03","observation_id":"f57e0b9c-59cf-41f1-8993-0601c061da3d","resolution":{"observed_at":"2026-08-06T16:39:11.793813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.600009Z","title":"Fmak: A dataset of key and mode annotations for the free music archive — extended abstract,","venue":null,"work_id":"136837fe-2967-4e1e-b686-a9a2d638ff1e","year":2023},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.358580Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:b60eb88e6127ecae366cb62623dc188a9ff9384725ca110921abca31c05b3f4f","observation_id":"fb7b11a9-cf16-4914-bc9f-73a996418e02","resolution":{"observed_at":"2026-08-06T16:39:11.672849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.429704Z","title":"Fma: A dataset for music analysis,","venue":null,"work_id":"e163ef2a-b153-4951-8cc1-dcefbef8bc7f","year":2017},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.454741Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:990ee6c47fc648a2cd71c7a8eb0fb269a5952c0336226456a0eaac93c492f302","observation_id":"393583d8-0ce4-4acb-9abe-90f78d0c1ea2","resolution":{"observed_at":"2026-08-06T16:39:11.533105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.274449Z","title":"Two datasets for tempo estimation and key detection in electronic dance music annotated from user corrections,","venue":null,"work_id":"08a4d1ec-1721-40d4-a3c2-b394852318ad","year":2015},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.556145Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:a3449d09694508af4471070ea206a4524e0ee97cbcf50523e7d93bdaf61df08c","observation_id":"3063df87-6c82-4bd2-a98a-4edb867b5bb5","resolution":{"observed_at":"2026-08-06T16:39:11.347013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:11.078591Z","title":"mir eval: A transparent implementation of common mir metrics","venue":null,"work_id":"b428c915-ea44-4080-90cc-840f533967c4","year":2014},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.677788Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:623f37ca838b10748670dd1b9e5214878697b16f5e85ab6ec563f8942969dabc","observation_id":"ba2be996-a008-4fa1-b968-c597459a6d6d","resolution":{"observed_at":"2026-08-06T16:39:11.165774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:10.876900Z","title":"A review of rhythm description systems,","venue":null,"work_id":"2ad5ac39-bd43-4005-aa3a-8975f17e4b72","year":2004},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.776398Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:1139892b8de728e62ebfd80ab298ebcc4ba560ba0b7047dd7bafc03e6d6ef593","observation_id":"62925702-eec5-4920-b9c8-4065d1b5b725","resolution":{"observed_at":"2026-08-06T16:39:10.976116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:10.683197Z","title":"Gtzan-rhythm: Extending the gtzan test-set with beat, downbeat and swing annotations,","venue":null,"work_id":"cafa4277-aaa0-4b1e-bd22-fa8f3dc61162","year":2015},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:09.901899Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:90e8f388cd634a80d48707956ff35c114f49ee1ce011a2f0b3bc16b8de7f5ca4","observation_id":"3ba7d9b7-59eb-4f66-a93e-aa8c1812e7e7","resolution":{"observed_at":"2026-08-06T16:39:10.785159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:10.477344Z","title":"Schubert winterreise dataset: A multimodal scenario for music analysis,","venue":null,"work_id":"86922354-1121-4723-b013-412435a9bbf4","year":2021},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:10.024726Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:55ab34c12a95dd5b10e0680bc5e8c1aa7bc9a71937124faa284762dd95f67853","observation_id":"fb905377-11eb-4d42-9753-ac852c47c827","resolution":{"observed_at":"2026-08-06T16:39:10.578157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:10.252233Z","title":"RWC music database: Popular, classical, and jazz music databases,","venue":null,"work_id":"550b6565-154f-40ce-b1e4-f6429246aadb","year":2002},"citing_paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:10.142767Z"},"links":{"citing_paper":"/paper/2507.12996"},"observation_digest":"sha256:b3dc87b950b74b0d9a06b0a0960d29e61a7f9e047b170a6b3579e6a314e7d1f1","observation_id":"2ed7c51a-01ef-4468-9312-d07b6765a3a5","resolution":{"observed_at":"2026-08-06T16:39:10.328692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12996","last_updated":"2025-07-17T11:13:11Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T16:30:53.384581Z","submitted_at":"2025-07-17T11:13:11Z","title":"Multi-Class-Token Transformer for Multitask Self-supervised Music Information Retrieval"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2507.12996."}