{"as_of":"2026-08-16T11:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c97033553322a0ab534fb6b90199c1ae8a67b78b6b90cc9e75665b61046d892","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:21:54.315426Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:21:54.133544Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T19:25:32.403339Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04215","snapshot_observed_at":"2026-08-05T10:21:54.133544Z","title":"PianoBind: A Multimodal Joint Em- bedding Model for Pop-piano Music","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.133544Z"},"links":{"cited_paper":"/paper/2509.04215","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:8e304ebb345329d9abbde4a92232eb2c5ebd8952841f2128d77760a628c1f3b9","observation_id":"2853a7ac-3707-41cb-95c7-fefb558096e7","resolution":{"observed_at":"2026-08-05T10:21:54.133544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"cited_work":{"arxiv_id":"2509.04215","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.04215","snapshot_observed_at":"2026-07-08T19:25:32.403339Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","venue":"cs.SD","work_id":"af58e947-97d2-4a6a-b721-476a0cb9f952","year":2025},"citing_paper":{"arxiv_id":"2607.05971","last_updated":"2026-07-07T08:04:56Z","snapshot_observed_at":"2026-08-13T02:50:42.238623Z","submitted_at":"2026-07-07T08:04:56Z","title":"Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T19:18:56.334254Z"},"links":{"cited_paper":"/paper/2509.04215","citing_paper":"/paper/2607.05971"},"observation_digest":"sha256:fb763633d98c76e99827cc50632e7eb9806e5dcd70649f34172fb31ec9231c52","observation_id":"7ebe0395-9509-48d8-92db-6cd7385b7699","resolution":{"observed_at":"2026-07-08T19:25:32.404599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.04215/citation-record","integrity":"/paper/2509.04215/integrity","json":"/paper/2509.04215/citation-record.json","paper":"/paper/2509.04215"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04215","snapshot_observed_at":"2026-08-05T10:21:54.133544Z","title":"PianoBind: A Multimodal Joint Em- bedding Model for Pop-piano Music","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.133544Z"},"links":{"cited_paper":"/paper/2509.04215","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:8e304ebb345329d9abbde4a92232eb2c5ebd8952841f2128d77760a628c1f3b9","observation_id":"2853a7ac-3707-41cb-95c7-fefb558096e7","resolution":{"observed_at":"2026-08-05T10:21:54.133544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.939680Z","title":null,"venue":null,"work_id":"9eebad98-e2a0-41cb-bf0c-2c5dcde9908f","year":null},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.139800Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:2f86262000c936726dbdaa185742c0cd5b4c9ae65edc7454c3f24823d0e262b3","observation_id":"c8618322-9246-4f8e-87fe-1a2ef8a075e9","resolution":{"observed_at":"2026-08-05T10:21:54.945268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.924668Z","title":null,"venue":null,"work_id":"7bf23403-9bff-40ea-af55-7a2bd61795ed","year":null},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.144740Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:4e83b96ed20938f8fffc3d5b4c2375cf4604ec943b136929f4dab363be675307","observation_id":"87762195-9e5e-4d0c-ae21-66a502b7cd4b","resolution":{"observed_at":"2026-08-05T10:21:54.929268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.909770Z","title":"The dataset consists of audio, MIDI, and textual descriptions, based on a comprehensive piano-specific taxonomy of 31 semantic tags across genre, emotion/mood, and style","venue":null,"work_id":"3e2e64f1-f554-4056-926f-3fdb1e459bbb","year":null},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.149617Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:ad0a4e2b4c4ab6a4b71ff1fc9c05430b16c92183acb9355c3ccb55ef5b8b5022","observation_id":"d909e1a3-b1e4-433a-aff0-f77712f8306d","resolution":{"observed_at":"2026-08-05T10:21:54.914886Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.895199Z","title":null,"venue":null,"work_id":"f9be7ac8-3825-489f-ac5d-631d44bd0439","year":null},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.154766Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:631a0499397a0566fa543500d3c462ec16ff06a5718ba8c6889f1ad0a8062520","observation_id":"2ab25384-4e3a-4b04-9173-a669e1ad1419","resolution":{"observed_at":"2026-08-05T10:21:54.900018Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.880466Z","title":"Despite us- ing substantially less training data than general-purpose models, PianoBind achieved strong retrieval performance","venue":null,"work_id":"a7704a5c-ff19-4acb-b22c-82da59e4a76f","year":null},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.159561Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:b5afacc6c5adade9270c73da1a4c20694155538c95eb601ded19b7a49c8d6d35","observation_id":"afed7f21-4d50-4fb1-85be-04bb9743a956","resolution":{"observed_at":"2026-08-05T10:21:54.885597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.865728Z","title":null,"venue":null,"work_id":"808a2e8c-2029-468f-84f5-71ec962dc5e1","year":null},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.164088Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:de3c236dcc92860d38446f505f5aae8eb45e5e39e184ec374d8c00daa9a6d926","observation_id":"a7a5167c-5b9a-45d1-b8ea-71ebede3fa6f","resolution":{"observed_at":"2026-08-05T10:21:54.870480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.851811Z","title":"Pop music transformer: Beat-based modeling and generation of expressive pop piano compositions,","venue":null,"work_id":"507674a1-4bc4-4cd7-8dc1-36230a4e1db8","year":2020},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.168981Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:518fc6f22b84f654a7e510ded7e9ea3ced910ee801725ae859048b3027158da5","observation_id":"2d71ba0b-4f88-4d0e-9a3a-0a73c169e32e","resolution":{"observed_at":"2026-08-05T10:21:54.856368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.837536Z","title":"Compound word transformer: Learning to compose full-song music over dynamic directed hypergraphs,","venue":null,"work_id":"8559f852-9df0-4a11-bee2-56be21b76fed","year":2021},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.173572Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:7952b04e6ed1e3fda7287f70ef117b2bf751b9c9d0159a913cc6d1a307409f4f","observation_id":"58ccd96c-680a-4ab5-b6a1-7c507151cc38","resolution":{"observed_at":"2026-08-05T10:21:54.842221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.822968Z","title":"Compose & embellish: Well-structured piano performance generation via a two-stage approach,","venue":null,"work_id":"c87bb9d3-9724-41ae-b45d-9b46a3c7463f","year":2023},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.177986Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:b03917bcdd2396cd56b419b0c2921e80fcb7ef417435f6bcccbfb12cfe609e2f","observation_id":"7b37f0be-6de1-490c-8ecf-6c01bb1bb523","resolution":{"observed_at":"2026-08-05T10:21:54.827428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.808214Z","title":"Picogen2: Piano cover generation with transfer learning approach and weakly aligned data,","venue":null,"work_id":"4f42688f-6c97-484f-a80c-c4c98a196f40","year":2024},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.182274Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:9b6d439b140b95e115fff3ee36383acbdea24fd1d57192fe6704afdb1b5f01fe","observation_id":"d692853a-8dcc-4aad-a4d6-1686f1c9fb80","resolution":{"observed_at":"2026-08-05T10:21:54.813118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.793586Z","title":"An end-to-end neural network for polyphonic piano music transcrip- tion,","venue":null,"work_id":"9cc12266-05de-4f0e-b332-d637021fb928","year":2016},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.187418Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:f6ec0376408fc5b6c6bba05005edb347f9e9259bd38b274d01c8a7b7719c35c4","observation_id":"97261ee6-1e10-4d9c-85ff-39623726ea91","resolution":{"observed_at":"2026-08-05T10:21:54.798360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.11153","last_updated":"2018-06-05T04:20:28Z","snapshot_observed_at":"2026-08-14T20:18:46.175847Z","submitted_at":"2017-10-30T18:05:49Z","title":"Onsets and Frames: Dual-Objective Piano Transcription","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.11153","snapshot_observed_at":"2026-08-05T10:21:54.193047Z","title":"Onsets and frames: Dual-objective piano transcription,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.193047Z"},"links":{"cited_paper":"/paper/1710.11153","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:ec265ac1e6f4f1aa7ee3667574aeabd049a0528bf2d36deb808ee34368d105dc","observation_id":"c72a5b68-dc7c-4934-987c-7dc2fc14699a","resolution":{"observed_at":"2026-08-05T10:21:54.193047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.778202Z","title":"High- resolution piano transcription with pedals by regress- ing onset and offset times,","venue":null,"work_id":"01d4cfac-8290-42b0-be6c-f7f826d78bc7","year":2021},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.198398Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:58ff725d7743808bc89fff1afc12f823b1fcdd49c00383b0af88e14f44f9e8eb","observation_id":"5308f619-7537-4540-86dd-3cbf70c4f464","resolution":{"observed_at":"2026-08-05T10:21:54.783115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.763591Z","title":"Polyphonic piano transcription using autoregressive multi-state note model,","venue":null,"work_id":"d42eda0c-d7e5-4dc1-a422-c646205dc947","year":2020},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.202967Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:478411b7be3995c87465539f5d60d27821a069a64cf2f9a0bdea9160f2793028","observation_id":"922ee16b-f8ce-430b-8367-7944279dcfd0","resolution":{"observed_at":"2026-08-05T10:21:54.768462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05223","last_updated":"2024-04-14T03:40:35Z","snapshot_observed_at":"2026-08-13T18:47:52.958028Z","submitted_at":"2021-07-12T07:03:57Z","title":"BERT-like Pre-training for Symbolic Piano Music Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05223","snapshot_observed_at":"2026-08-05T10:21:54.207405Z","title":"MidiBERT-Piano: Large-scale pre-training for symbolic music understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.207405Z"},"links":{"cited_paper":"/paper/2107.05223","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:70da2ce9ce99afdfa5cb23a716c4c94dc2df67a94ae487dd71def06d18ae76a3","observation_id":"dc01f53e-e969-4b9d-97f4-43e2a834822c","resolution":{"observed_at":"2026-08-05T10:21:54.207405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.748789Z","title":"Pianobart: Symbolic piano music gener- ation and understanding with large-scale pre-training,","venue":null,"work_id":"aacadc9f-b103-4f51-9a05-b405d93748f7","year":2024},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.212365Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:0a89729fdb7e297035cf1f58ad6106ebe51c41fe979a94c3e36ecbdc28da560e","observation_id":"7781e69c-dab1-482c-9dd4-9a553f8709da","resolution":{"observed_at":"2026-08-05T10:21:54.753658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-08-15T03:05:11.482941Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-05T10:21:54.216932Z","title":"Mulan: A joint embedding of music audio and natural language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.216932Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:b9aeeb1ba942663255635944395b16de1ff83463f55b0ec0566862d3fe88f5b0","observation_id":"a4784200-4947-4cd9-b1c1-29d31da4a85d","resolution":{"observed_at":"2026-08-05T10:21:54.216932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.733755Z","title":"Contrastive audio-language learning for music,","venue":null,"work_id":"a8179a0b-2cc2-4bd3-aa09-5e969666125c","year":2022},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.222309Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:dacab944741b4960501df768d3dd29bba63d5eee2cd1b741b64df4e11000cbbd","observation_id":"8d3add02-7927-4e41-b5f3-f763b67ed66f","resolution":{"observed_at":"2026-08-05T10:21:54.738429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.719015Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"06a50a0b-e2ad-4fb9-8a11-f65fae0f50f1","year":2023},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.226563Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:e076b577cbb849178fb3297eae613ec3f16b390502bb128b4ea3cd57a332591d","observation_id":"78f6b626-8559-4afa-a65c-4de24b76320a","resolution":{"observed_at":"2026-08-05T10:21:54.723967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.703110Z","title":"Toward uni- versal text-to-music retrieval,","venue":null,"work_id":"d794596a-e824-45de-a3ed-2f60f9792728","year":2023},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.231265Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:290f3a8f028fb6b20646ac886d8b93589486409f31d6d4e7c01f75dbd565a73e","observation_id":"c148d76c-c1ab-4718-9da1-810539a18e96","resolution":{"observed_at":"2026-08-05T10:21:54.708496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.687783Z","title":"Enriching music descriptions with a finetuned-llm and metadata for text-to-music retrieval,","venue":null,"work_id":"d012c3cc-40a0-4265-bf7c-8e7507b4eb91","year":2024},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.235761Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:06621fa31be4566f1cb76c062f85ace5d1f3e5c9b6b07b010619f60275dda5b2","observation_id":"66e61fc3-418f-4e21-a00a-1bf4461532f0","resolution":{"observed_at":"2026-08-05T10:21:54.692710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11029","last_updated":"2023-10-18T17:16:28Z","snapshot_observed_at":"2026-08-13T11:58:00.266335Z","submitted_at":"2023-04-21T15:23:00Z","title":"CLaMP: Contrastive Language-Music Pre-training for Cross-Modal Symbolic Music Information Retrieval","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11029","snapshot_observed_at":"2026-08-05T10:21:54.241096Z","title":"Clamp: Con- trastive language-music pre-training for cross-modal symbolic music information retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.241096Z"},"links":{"cited_paper":"/paper/2304.11029","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:a6845fceeaf5e4da04e3c5c7652d39fe7c082a87d7e66ae367e2831c11e11227","observation_id":"54cf2a06-1751-48c1-9b12-a922197c5591","resolution":{"observed_at":"2026-08-05T10:21:54.241096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13267","last_updated":"2025-01-23T19:38:53Z","snapshot_observed_at":"2026-08-12T22:21:15.547308Z","submitted_at":"2024-10-17T06:43:54Z","title":"CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.13267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13267","snapshot_observed_at":"2026-08-05T10:21:54.439842Z","title":"CLaMP 2: Multimodal Music Information Retrieval Across 101 Languages Using Large Language Models","venue":"cs.SD","work_id":"8649bf9d-fa5c-4573-b642-9ab6f5baeaa4","year":2024},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.246481Z"},"links":{"cited_paper":"/paper/2410.13267","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:90fc4680d45d419f55c1dd85ed87a0a6dcbd324d711dcc8e88d68f8b5b3dd75a","observation_id":"0634b207-3794-4ebc-bd97-d99721ad71db","resolution":{"observed_at":"2026-08-05T10:21:54.445223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10362","last_updated":"2025-05-18T16:25:19Z","snapshot_observed_at":"2026-08-15T16:50:57.250725Z","submitted_at":"2025-02-14T18:42:25Z","title":"CLaMP 3: Universal Music Information Retrieval Across Unaligned Modalities and Unseen Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10362","snapshot_observed_at":"2026-08-05T10:21:54.251675Z","title":"Clamp 3: Universal music information retrieval across unaligned modalities and unseen languages,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.251675Z"},"links":{"cited_paper":"/paper/2502.10362","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:c049ea7e3b729dca7943a6c829a1453b7af441a9b3243e269ae81330ee13fb52","observation_id":"cfb35c3b-8e46-41f8-9019-8c91bfe97856","resolution":{"observed_at":"2026-08-05T10:21:54.251675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.671449Z","title":"PIAST: A multimodal piano dataset with audio, symbolic and text,","venue":null,"work_id":"7ea23406-381c-4d58-bfe1-e641d10485aa","year":2024},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.256963Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:8aee78139da2c1b23c93a6c76a56090081cf03c7149f1f3e406be7e401a4229e","observation_id":"23370b19-77af-4595-bf6f-c241ef924570","resolution":{"observed_at":"2026-08-05T10:21:54.676917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07118","last_updated":"2020-08-17T06:48:59Z","snapshot_observed_at":"2026-08-12T10:19:25.399047Z","submitted_at":"2020-08-17T06:48:59Z","title":"PIANOTREE VAE: Structured Representation Learning for Polyphonic Music","version":1},"cited_work":{"arxiv_id":"2008.07118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.07118","snapshot_observed_at":"2026-08-05T10:21:54.401029Z","title":"PIANOTREE VAE: Structured Representation Learning for Polyphonic Music","venue":"eess.AS","work_id":"284b08fe-f721-4c99-9c5e-4571a7fe3188","year":2020},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.261546Z"},"links":{"cited_paper":"/paper/2008.07118","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:1607356db64be06978ad75896f34f3d55fa325fbdcd7118d4abc4047a788bada","observation_id":"44211953-33b7-4dcc-b061-be4ea88993bc","resolution":{"observed_at":"2026-08-05T10:21:54.408042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.653542Z","title":"Learning in- terpretable representation for controllable polyphonic music generation,","venue":null,"work_id":"1e1e6489-9c93-44ee-87e0-10b82139bdc2","year":2020},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.266460Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:f56098478bc6315cd482304b649fc7fa3d8b9e9b0d9a4119d8aea3fa9ee2d590","observation_id":"61ec0cf8-725b-489a-992c-509959e9a538","resolution":{"observed_at":"2026-08-05T10:21:54.658393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.638217Z","title":"Collagenet: Fusing arbitrary melody and accompani- ment into a coherent song,","venue":null,"work_id":"223254c6-7d61-4eb8-b6c4-38d851f3ebed","year":2022},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.271244Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:3a63b132dff5d37f55206338b6a85992968511027b60afaa06f0363537c86e6a","observation_id":"8638d709-8fb9-4bb9-a56f-4ff6f1e098c2","resolution":{"observed_at":"2026-08-05T10:21:54.643219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.622874Z","title":"EMOPIA: A multi-modal pop piano dataset for emotion recognition and emotion-based music gen- eration,","venue":null,"work_id":"67d393b3-5d53-4bfc-b3aa-519d836bc52a","year":2021},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.275654Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:2c0643bb40f529d6c32a8c32aff5a59910f69ac9db58ca51989e8c30ea486ca2","observation_id":"f9615403-d6e9-4cd9-b985-f9edfb7437cf","resolution":{"observed_at":"2026-08-05T10:21:54.627986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.607509Z","title":"A powerful gener- ative model using random weights for the deep image representation,","venue":null,"work_id":"aa0ebf16-98a4-4461-b0bb-9672eb14e01b","year":2016},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.280025Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:dc85ec556dc6cf5acbd38903a40fa97f6098912cfcdf083a78d1d045b4adab57","observation_id":"99ae3455-b0b5-4d2c-82b7-fe0c7c5c4792","resolution":{"observed_at":"2026-08-05T10:21:54.612538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-05T10:21:54.284581Z","title":"Roberta: A robustly optimized BERT pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.284581Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:464cb4885edb864ff81e1b8971be62cc0b7f5d931360fe2d3d33b60684964f93","observation_id":"843c1271-0ac8-408f-83a8-b4a6a537bdd9","resolution":{"observed_at":"2026-08-05T10:21:54.284581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T10:21:54.293496Z","title":"Representa- tion learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.293496Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:e6ad06562d99a938f3d6a177cf10017f9dd55e63115ba71bf836d60cb6af2c6a","observation_id":"e3c8424b-2951-4137-8aab-57f2bdc18807","resolution":{"observed_at":"2026-08-05T10:21:54.293496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03017","last_updated":"2022-03-15T17:13:12Z","snapshot_observed_at":"2026-08-15T15:01:35.522160Z","submitted_at":"2021-11-04T17:19:39Z","title":"MT3: Multi-Task Multitrack Music Transcription","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03017","snapshot_observed_at":"2026-08-05T10:21:54.297833Z","title":"Mt3: Multi-task multitrack music transcrip- tion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.297833Z"},"links":{"cited_paper":"/paper/2111.03017","citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:246964f8620784aeacc25907be4ebdabe7fe6f8b04533fcebac5b6b7680490e8","observation_id":"5cc59db3-58d9-47d2-890d-8a054b44f668","resolution":{"observed_at":"2026-08-05T10:21:54.297833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.302122Z","title":"Large-scale contrastive language- audio pretraining with feature fusion and keyword-to- caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.302122Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:1d9ee32eeccba24964f7bcc097a4d5be6bdd7e9cf5630041b346ad15b5469b0d","observation_id":"9dbe1575-92c5-45fd-8a3d-8269bd48452e","resolution":{"observed_at":"2026-08-05T10:21:54.302122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.567499Z","title":"Lp-musiccaps: Llm-based pseudo music captioning,","venue":null,"work_id":"628abfd9-8738-40c3-8401-44b615048ffc","year":2023},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.306756Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:5ac1106d45b452b025ce416bb44ad2afd596b6d687d5f15118ec32c7bb6572cf","observation_id":"af73fe56-52be-44be-9c0c-acbbbcc314db","resolution":{"observed_at":"2026-08-05T10:21:54.572081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.551252Z","title":"Au- dioclip: Extending clip to image, text and audio,","venue":null,"work_id":"6194ad5b-8ce4-4c5f-8917-c69111e8c911","year":2022},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.311165Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:12f1edb5cbdd63b4a219c15b659c86a0e0d10d90eabc51a8071f86aa6ae0aa1d","observation_id":"39cae16b-7f60-451a-9334-c3fafc019458","resolution":{"observed_at":"2026-08-05T10:21:54.556543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.535731Z","title":"Chatgpt-4o (gpt-4 omni),","venue":null,"work_id":"6806162e-96aa-4cb0-9f9e-fa88400e4680","year":2024},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.315426Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:3a7180cac17d50596e0e778fef5b674069f2715f5224b359931313dfabc24e13","observation_id":"e0e71461-d22e-4426-97a7-6fd9315f52a0","resolution":{"observed_at":"2026-08-05T10:21:54.540432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:21:54.592289Z","title":"Available: http://arxiv.org/abs/1907","venue":null,"work_id":"80a49256-ec33-4e3d-b454-546b1fdfec5e","year":1907},"citing_paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T10:21:54.289247Z"},"links":{"citing_paper":"/paper/2509.04215"},"observation_digest":"sha256:f4a82f9117d856daec75710d81f11ad1933b852e3483ff0bf6e92638a97ee3eb","observation_id":"fbfcd82d-c82a-427c-9a8a-d038f3b6e11b","resolution":{"observed_at":"2026-08-05T10:21:54.596919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.04215","last_updated":"2025-09-04T13:43:53Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T20:54:57.799670Z","submitted_at":"2025-09-04T13:43:53Z","title":"PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2509.04215."}