{"as_of":"2026-08-09T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac80909de539601dee63fefb31cdab2d8b0139d6b2fc11dcbba71a0fa787022a","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:51:21.844168Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T08:09:35.025440Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T13:28:18.509872Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"cited_work":{"arxiv_id":"2502.07711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07711","snapshot_observed_at":"2026-07-03T13:28:18.509872Z","title":"RenderBox: Expressive perfor- mance rendering with text control","venue":null,"work_id":"b0246487-2ecc-4fcb-aeea-9f25194ff4af","year":2025},"citing_paper":{"arxiv_id":"2605.02059","last_updated":"2026-05-06T14:14:18Z","snapshot_observed_at":"2026-08-02T17:18:57.755081Z","submitted_at":"2026-05-03T21:06:08Z","title":"RenCon 2025: Revival of the Expressive Performance Rendering Competition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T18:34:38.534723Z"},"links":{"cited_paper":"/paper/2502.07711","citing_paper":"/paper/2605.02059"},"observation_digest":"sha256:abc287e5cd83b5ff0d3b4c376cf049e36f040eeba1799acff141efa3260aeb5b","observation_id":"646c68db-ef3b-4423-b12e-6f925e77fc31","resolution":{"observed_at":"2026-05-09T06:20:41.890532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"cited_work":{"arxiv_id":"2502.07711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07711","snapshot_observed_at":"2026-07-03T13:28:18.509872Z","title":"RenderBox: Expressive perfor- mance rendering with text control","venue":null,"work_id":"b0246487-2ecc-4fcb-aeea-9f25194ff4af","year":2025},"citing_paper":{"arxiv_id":"2605.14555","last_updated":"2026-05-14T08:32:38Z","snapshot_observed_at":"2026-08-02T19:29:24.447293Z","submitted_at":"2026-05-14T08:32:38Z","title":"Break-the-Beat! Controllable MIDI-to-Drum Audio Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T01:28:16.995989Z"},"links":{"cited_paper":"/paper/2502.07711","citing_paper":"/paper/2605.14555"},"observation_digest":"sha256:5c2465cd39099db0666887f0c3e83d842498e0415ee5f8a0f4d4face6531903b","observation_id":"bf38a8b0-ad10-4c31-97e9-f8d432093539","resolution":{"observed_at":"2026-05-15T01:28:26.958251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"cited_work":{"arxiv_id":"2502.07711","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07711","snapshot_observed_at":"2026-07-03T13:28:18.509872Z","title":"RenderBox: Expressive perfor- mance rendering with text control","venue":null,"work_id":"b0246487-2ecc-4fcb-aeea-9f25194ff4af","year":2025},"citing_paper":{"arxiv_id":"2606.12282","last_updated":"2026-06-10T16:20:24Z","snapshot_observed_at":"2026-08-08T10:39:48.827846Z","submitted_at":"2026-06-10T16:20:24Z","title":"PianoKontext: Expressive Performance Rendering from Deadpan Context","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T08:09:35.025440Z"},"links":{"cited_paper":"/paper/2502.07711","citing_paper":"/paper/2606.12282"},"observation_digest":"sha256:eddb72ef1890919813610fe6cd8d0727f06943f414f8e13c57443bd461eba8c4","observation_id":"6f89f6da-b7f2-46d6-962f-56f4c1aa8aaa","resolution":{"observed_at":"2026-07-03T13:28:18.511475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07711/citation-record","integrity":"/paper/2502.07711/integrity","json":"/paper/2502.07711/citation-record.json","paper":"/paper/2502.07711"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-08T11:51:21.707531Z","title":"Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Cail- lon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.707531Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:1762c9f4d4df201782fc981a8f3db6db58be7e7ea42ba06e5176bb31d50e484e","observation_id":"b3f88983-e615-48f6-835d-4ca8fd1ae262","resolution":{"observed_at":"2026-08-08T11:51:21.707531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.271407Z","title":"Director Musices : The KTH Performance Rules System","venue":null,"work_id":"05142ca2-1b2f-4857-b4f0-76551f22e235","year":2002},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.720020Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:d22790304633f8e707d5c25d67332a8446b0b904f216750832073bd76a4da964","observation_id":"2a854a38-d700-4c14-a344-68478469dd7d","resolution":{"observed_at":"2026-08-08T11:51:22.275091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.221507Z","title":"Look, Listen, and Learn More: Design Choices for Deep Audio Embeddings,","venue":null,"work_id":"21139ef4-6e9c-43de-a121-be50b5de56f4","year":2019},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.738651Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:028536aa758bde2ae76950358274b9a64c843809589d0818203035ff90957f09","observation_id":"6d7ad632-1be3-42c7-8baa-18d14812e7c2","resolution":{"observed_at":"2026-08-08T11:51:22.225016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.201347Z","title":"From MNIST to ImageNet and back: benchmarking continual curriculum learning","venue":null,"work_id":"eab61225-cc4e-4535-8519-105ea87fa2cd","year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.749641Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:f16f391770fc6ab7917b4698e284ada11197da9c78481235b453a18b62724bc7","observation_id":"f9df499b-972b-4980-a13f-6ddd4508852d","resolution":{"observed_at":"2026-08-08T11:51:22.205133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.191979Z","title":"Ren- con: Performance Rendering Contest for Automated Mu- sic Systems","venue":null,"work_id":"4fde0718-5828-4e45-93b3-fd82b2bf80d3","year":2008},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.753253Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:a6b108cd0a41c0e7fe8cf08565908f6cd3da7bf15a140615069bce4c3f32f05c","observation_id":"5199f80c-9a78-423a-ad5e-379ab8e88415","resolution":{"observed_at":"2026-08-08T11:51:22.195421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.172137Z","title":"VirtuosoNet: A Hierar- chical RNN-based System for Modeling Expressive Piano Performance","venue":null,"work_id":"cc8b2c30-7e4b-40b2-bbcb-207c0448385e","year":2019},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.760007Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:4fc28aa29fa84aec71d8f5d50e7afb20b905c916a7fd26c87fc11fbbe9ead7e4","observation_id":"d39e4166-cf0d-462a-89fd-f6dbaf9a02e1","resolution":{"observed_at":"2026-08-08T11:51:22.175656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.162090Z","title":"V oicebox: Text-Guided Multilingual Uni- versal Speech Generation at Scale","venue":null,"work_id":"b303f6f8-c471-4b5a-a2b4-dc303e06dfcd","year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.763388Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:007b0c3374dbabb942540c9aced3fa2ebfc01cfefdce784630f246dfefa74515","observation_id":"42744550-fdf1-44e9-84d6-f8d49d5d58e9","resolution":{"observed_at":"2026-08-08T11:51:22.165791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.151742Z","title":"Content-based Controls for Music Large Lan- guage Modeling","venue":null,"work_id":"776f8790-24a8-473f-ab78-fe1492d3e006","year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.766733Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:98960d800cb7f22e4e9c6e53076d3fc21a91bc1e148d71a1440ea7feaa35706e","observation_id":"cbfbbe37-a91f-4455-9759-612ab98888c7","resolution":{"observed_at":"2026-08-08T11:51:22.155439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.141351Z","title":"Rendering music performance with interpretation variations using con- ditional variational RNN","venue":null,"work_id":"d300d410-a607-483b-8fcc-67c8fc571b24","year":2019},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.770032Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:31bf4b17af1cba2436e72cab9864be6d9d6979a3cd20025d48973373b3b86a87","observation_id":"4c554c1a-86df-4820-aa97-dd2a9badd95a","resolution":{"observed_at":"2026-08-08T11:51:22.145029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.131087Z","title":null,"venue":null,"work_id":"13318faf-d2e1-4eb5-baf6-54c61e73e11f","year":2022},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.773400Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:6b6b4871231b7968737ce9b7d4b0652c548ae095d6179c6cd24abd7cf25d1fa8","observation_id":"b6df2299-c504-460b-8895-7f5421c07d27","resolution":{"observed_at":"2026-08-08T11:51:22.134413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.120461Z","title":"Mustango: Toward Control- lable Text-to-Music Generation","venue":null,"work_id":"c530bcd5-c5e3-4657-8923-3757bea8a7bc","year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.776673Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:1ea1258a41495fe3a9f581e36d23582845dfc3e3c8af4f6f8f032e8bb4f4387c","observation_id":"1800fcce-dc9c-404b-9ca7-14ff76f52b8d","resolution":{"observed_at":"2026-08-08T11:51:22.124314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.109927Z","title":"Simulating Piano Performance Mistakes for Music Learning","venue":null,"work_id":"27d4dec7-5125-4ae5-96b8-7743fad6c20f","year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.780053Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:96d9b808cd0bc387dc015b6db253b8f12b790b9f293f71b906b672cf8f8890cc","observation_id":"9310194d-9b8a-4015-a830-a94cbbdc4bc6","resolution":{"observed_at":"2026-08-08T11:51:22.113681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.100346Z","title":"Diff- A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models","venue":null,"work_id":"3cf1a5e5-fe45-48e0-a9d2-1bb1397c640e","year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.783310Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:7a2e66bd5361fc1c7e803797ca06b1a82e6dfe98ce84c26942cf48a0467157ec","observation_id":"231072a4-7ee9-4a57-9fe7-9da9f9ecb40d","resolution":{"observed_at":"2026-08-08T11:51:22.103836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.090732Z","title":"Anatomy of a perfor- mance: Sources of musical expression","venue":null,"work_id":"ef936d9b-1b9d-44f2-825b-6d57bd849654","year":1996},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.786636Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:b6403564d37e7f6ef127039009b0c108782da80f2bfbf08114bc2e944a61931c","observation_id":"132528cb-c072-43f6-abf9-8ea6bae4051c","resolution":{"observed_at":"2026-08-08T11:51:22.094076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.071908Z","title":"Automatic Note-Level Alignments in the ASAP Dataset","venue":null,"work_id":"35277a13-8ab2-4886-8cf0-6870adbe92d1","year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.793114Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:441bc11162c1564e631061e712c4e5adff17e21ea59a2b901ef2c913e4cd7bb6","observation_id":"d196043d-f25a-43bb-9ccb-6ba9a2e9ceea","resolution":{"observed_at":"2026-08-08T11:51:22.075170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.062199Z","title":"Heinrich Neuhaus: A Life beyond Music","venue":null,"work_id":"ae49eea3-873f-4b97-8214-4c6ad34eca57","year":2018},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.796452Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:f0a7a48c863aeee8fd262c437554a9aa2db1e03c5ac88ec23f3844f2f3a68f83","observation_id":"e79d57f7-1690-4b5f-ad2c-8df571879c66","resolution":{"observed_at":"2026-08-08T11:51:22.065676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.052384Z","title":"Differentiable Piano Model for MIDI-to- Audio Performance Synthesis","venue":null,"work_id":"262e30ff-a66d-41c6-bc81-28326c8a88cf","year":2022},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.799660Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:bd0fc09ff6580249392284d0e5689420dc43fb9d1ef98fd998ed99e870a202ac","observation_id":"df3e8ac3-11f2-482a-9dcf-ee08f8a8b06e","resolution":{"observed_at":"2026-08-08T11:51:22.055943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.041906Z","title":"Quantitative Effects of Global Tempo on Expressive Timing in Music Performance: Some Perceptual Evidence","venue":null,"work_id":"e7b2df79-e170-43df-8a5a-000f52d931ae","year":1995},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.802822Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:4e93594f5638e987e302fffb57672672a4ad095212aba69cbb4341d9c8f5ff5a","observation_id":"f986dba2-8622-4b3b-912f-cae00aaa8184","resolution":{"observed_at":"2026-08-08T11:51:22.046044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.020248Z","title":"Sketching the Expression: Flexible Rendering of Ex- pressive Piano Performance with Self-Supervised Learn- ing","venue":null,"work_id":"a38fdc2e-13f4-42bc-b7af-3827defae88c","year":2022},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.809851Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:45b538eabe659422269777c45538c905f1dd8e65f884629dafc73ac9196aa79d","observation_id":"21d61612-5804-4551-8e32-64b61fa46846","resolution":{"observed_at":"2026-08-08T11:51:22.024055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.008425Z","title":"GAPS: A Large and Diverse Classical Guitar Dataset and Benchmark Transcription Model","venue":null,"work_id":"e5de730e-a201-4a81-9c3c-0da9809b2c9c","year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.813037Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:654c7d8fc511d4ab53c3039dd73be95fd49ea113761a966254c0666b0bca91b6","observation_id":"c6c9dbfe-ffe3-4404-a1df-8dd884ebbb1c","resolution":{"observed_at":"2026-08-08T11:51:22.012356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:21.998031Z","title":"Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation","venue":null,"work_id":"35c2f053-1d9f-4160-a205-927919fb2bc3","year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.816409Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:0590a484bb5959f82844b793a2113c315bd453563079922eb5581d96e0a5f48c","observation_id":"11bb752d-0b89-446f-b50d-270cf529d6b7","resolution":{"observed_at":"2026-08-08T11:51:22.001765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-08T11:51:21.819764Z","title":"Audiobox: Unified Au- dio Generation with Natural Language Prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.819764Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:8aa3e555008a0fda5db929d3a435f487bbf546971908f414639ae1ec45a9bdc8","observation_id":"5236f2fc-4bde-4a3f-a90b-7afba7cc9d0f","resolution":{"observed_at":"2026-08-08T11:51:21.819764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:21.987483Z","title":"Continual learning of new sound classes using generative replay","venue":null,"work_id":"e7e7ab5f-166d-4db1-a94c-d7c59ce2d9e3","year":2019},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.823306Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:2e1fbd830cedc1427d1517836fae69a7c9b6ae4ad004102e55f2c2d13ff74052","observation_id":"5056e4af-25e9-4e04-ab23-a81adae177c5","resolution":{"observed_at":"2026-08-08T11:51:21.991165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:21.976269Z","title":"A Survey on Curriculum Learning","venue":null,"work_id":"545f1960-c033-402b-a242-2ef253e6b38a","year":2022},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.826653Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:a1c999e4b8a19c320c18c2c2233c059f7dd649f71f546249d1f22db12ef14802","observation_id":"d04ecbfb-a819-4570-ba7a-8cf97cf074ed","resolution":{"observed_at":"2026-08-08T11:51:21.980048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:21.964790Z","title":"Large-Scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmenta- tion","venue":null,"work_id":"5bbcdcf1-325d-412b-afbb-64b61ef9f2d8","year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.830271Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:0e753eb7027366f8a7c23845922c252d17506f128287a89ce4599edf2ef96c7b","observation_id":"c9c6b355-fd33-4fa1-bd3d-80e18e110e70","resolution":{"observed_at":"2026-08-08T11:51:21.968563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:21.953929Z","title":null,"venue":null,"work_id":"add728a0-6af6-4041-ab89-6af781987a7c","year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.833907Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:9041627b6b3aacc93bc8cf34ff19d3ade87d4bdc24db2a77ac21811ab44b4329","observation_id":"e0ce4a62-31ad-4427-b60d-9ad6c3d7635b","resolution":{"observed_at":"2026-08-08T11:51:21.957794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:21.943105Z","title":"ATEPP: A Dataset of Automatically Transcribed Expressive Piano Performance","venue":null,"work_id":"5b7743fa-21fa-4428-badc-3ef9945abe8e","year":2022},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.837249Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:2344adbcaeb9a8720897633d02a24ae2b947c1f0cebeaf5cbacf8aa547561120","observation_id":"f8c7cc00-9645-40a6-8864-cc24b7b497df","resolution":{"observed_at":"2026-08-08T11:51:21.946891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:21.932146Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","venue":null,"work_id":"81f21add-ad2c-4333-b132-4a063c9f2261","year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.840688Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:c2dac9801df4fd68433fd574b7ff468875feb819b1ddb72b01124b3d8e66908c","observation_id":"25dbbd74-7355-4c3b-9abe-113d48c5d5c5","resolution":{"observed_at":"2026-08-08T11:51:21.935784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:21.920443Z","title":"LLaQo: Towards a Query-Based Coach in Expressive Music Per- formance Assessment","venue":null,"work_id":"7b801e55-46eb-4f87-a4dd-bdeca8024135","year":2025},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.844168Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:79fe14d65b698fe99bbb2cd4d3ffe607ad3e47af2ae41a594dcf6df3ead1a9d0","observation_id":"ace2324e-9c77-43d9-a045-66ad1848534f","resolution":{"observed_at":"2026-08-08T11:51:21.924278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.031150Z","title":"Pedal Timing and Tempo in Expressive Piano Performance: A Preliminary Investiga- tion","venue":null,"work_id":"f8a6b934-baf6-421b-94c6-767c148a5d59","year":1996},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.806369Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:ce268a408f9d53cd13ff341ea6e523d665e1ef3bc91967e4bb5f13b5e74a472e","observation_id":"f63e1bb2-c39c-4217-9900-141f7a7ac66a","resolution":{"observed_at":"2026-08-08T11:51:22.034943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.081278Z","title":"FiLM: Vi- sual reasoning with a general conditioning layer","venue":null,"work_id":"eedfbdad-e609-477a-a68f-c82fbb89908d","year":2018},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.789815Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:5cdd46746be391478121f22b2ee4aa316fc305181a27ac28612c557fc76a16eb","observation_id":"582ed2d4-61a5-45c0-a689-9447f3ff64f5","resolution":{"observed_at":"2026-08-08T11:51:22.084653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.260965Z","title":"On the Characterization of Expressive Per- formance in Classical Music: First Results of the Con Espressione Game","venue":null,"work_id":"6730da6a-6ecf-4496-94b8-91de168f3c73","year":2020},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.724099Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:1d9f42d5775d8183f88ec03ed6907f65386f0ee38b13af5bb5503413af808d39","observation_id":"1c549fd7-ebd6-4308-bacc-2f246ca12200","resolution":{"observed_at":"2026-08-08T11:51:22.264749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.182387Z","title":"Multi-instrument Music Syn- thesis with Spectrogram Diffusion","venue":null,"work_id":"5d5aa5c4-2a75-49ce-9f0c-2132a1fdbf78","year":2022},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.756497Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:65c7d42f145c2000ee2640634939f15839bf42ce47e61c38b1cf5c1f5643474c","observation_id":"218bd1ab-63cc-43ad-ad39-4dee9bfa88d6","resolution":{"observed_at":"2026-08-08T11:51:22.185835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.241214Z","title":"COCOLA: Coherence-Oriented Con- trastive Learning of Musical Audio Representations","venue":null,"work_id":"78247e69-e118-43dd-a6f9-6d643939b5c9","year":2025},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.731890Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:93ba96c880b89da633253648a22e71a198874d654d3b98824e6bb9c4185035a0","observation_id":"2255ab68-e88e-4fd2-b2f6-893514b3b2c3","resolution":{"observed_at":"2026-08-08T11:51:22.244791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.211456Z","title":"Deep Performer: Score-to-audio Music Performance Synthesis","venue":null,"work_id":"a8b169e2-741e-4aa1-8712-4154947d32c5","year":2022},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.742108Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:5b2d2f19313db5e7eea1a5e90bf44275e1d83f9afcccfbe58d3984f783551cc4","observation_id":"40d06e0d-bcdc-43d4-9204-be594f97d684","resolution":{"observed_at":"2026-08-08T11:51:22.215004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.250850Z","title":"Computational Modeling of Expressive Music Perfor- mance with Linear and Non-linear Basis Function Models","venue":null,"work_id":"ff1a0a72-223c-497c-a7eb-20ed5d06d0a0","year":2018},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.727898Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:e944b3ee7bf4f7bb7d850fb45b1b1fed658b931131ca6e572b11163dd7960ccd","observation_id":"3460c8d8-c57a-4826-b899-09875638d6a6","resolution":{"observed_at":"2026-08-08T11:51:22.254429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-06T16:30:00.821754Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-08T11:51:21.745748Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.745748Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:d25f23974c773de4250f187ba4cf3038db44051143b123ea5f224ce0f5eb306b","observation_id":"abae9793-14be-4230-ad20-0792f6efabcf","resolution":{"observed_at":"2026-08-08T11:51:21.745748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00465","last_updated":"2024-07-26T07:57:18Z","snapshot_observed_at":"2026-07-06T18:38:59.090751Z","submitted_at":"2024-06-29T15:21:20Z","title":"Characterizing Continual Learning Scenarios and Strategies for Audio Analysis","version":2},"cited_work":{"arxiv_id":"2407.00465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.00465","snapshot_observed_at":"2026-08-08T11:51:21.895415Z","title":"Characterizing Continual Learning Scenarios and Strategies for Audio Analysis","venue":"cs.SD","work_id":"9f7d44a0-7b0d-47f2-ae56-c839e78c5ee2","year":2024},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.712106Z"},"links":{"cited_paper":"/paper/2407.00465","citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:2e018292013079de2aa0d90f3e174770cf61c9f3954810c2e779b2e6ff1d683f","observation_id":"90cabae6-018b-4765-8507-3b8a7c851f55","resolution":{"observed_at":"2026-08-08T11:51:21.901857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.281868Z","title":"ScorePerformer : Expressive Piano Performance Render- ing with Fine-grained Control","venue":null,"work_id":"271e5b39-efc9-4227-91a5-68070bcf5ec8","year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.716205Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:903a547dfa9eb317579ac062a33297befcca48776d5be3fa09314ce37ea1b347","observation_id":"90965549-67f8-470b-9db1-e72e0a50e28e","resolution":{"observed_at":"2026-08-08T11:51:22.285846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:51:22.231651Z","title":"Simple and Controllable Music Gen- eration","venue":null,"work_id":"892cfcaf-d5d4-40ec-b888-8f4205e3d2b9","year":2023},"citing_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T11:51:21.735217Z"},"links":{"citing_paper":"/paper/2502.07711"},"observation_digest":"sha256:78618f0506a3aebfd00d7cb8842b4e68a95e7818c950daa7e26e898cebba4659","observation_id":"c92bedb2-a424-456a-bf8e-2260e0f7d2bf","resolution":{"observed_at":"2026-08-08T11:51:22.235109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T03:28:24.877143Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 3 inbound Pith citation observations for arXiv:2502.07711."}