{"as_of":"2026-08-10T06:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f29fa3bf7510d1b744e3fbdfac2939767b7ea2ec2d87afb4e7be122f71c43100","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:52:43.212465Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:52:40.712471Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14537","snapshot_observed_at":"2026-08-02T01:52:40.712471Z","title":"zooming in","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:40.712471Z"},"links":{"cited_paper":"/paper/2607.14537","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:886341c3a5cd57da3d64b096cf43198677762640dc6e20ef7a1c617917668d18","observation_id":"3fa39840-3961-43e3-a373-51cd70eccff1","resolution":{"observed_at":"2026-08-02T01:52:40.712471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.14537/citation-record","integrity":"/paper/2607.14537/integrity","json":"/paper/2607.14537/citation-record.json","paper":"/paper/2607.14537"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14537","snapshot_observed_at":"2026-08-02T01:52:40.712471Z","title":"zooming in","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:40.712471Z"},"links":{"cited_paper":"/paper/2607.14537","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:886341c3a5cd57da3d64b096cf43198677762640dc6e20ef7a1c617917668d18","observation_id":"3fa39840-3961-43e3-a373-51cd70eccff1","resolution":{"observed_at":"2026-08-02T01:52:40.712471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:40.756294Z","title":"Multi-Level Dropout","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:40.756294Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:23e3309e5d5d7c79e87e679ca8a6450aeb976df9eb8af1c852519ada3873fcaa","observation_id":"75bc6ce2-f1f8-49f3-ba8d-677810f402a2","resolution":{"observed_at":"2026-08-02T01:52:40.756294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:40.839393Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:40.839393Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:c2b7107b261e164b8504c97074b67bae128c91f599f39073db5d4e21d2e9f72f","observation_id":"b95b2490-57e8-4cc3-972a-9a333aebd4c5","resolution":{"observed_at":"2026-08-02T01:52:40.839393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:40.893796Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:40.893796Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:bc7ce0b027c5c6b2d2ce2583bfd448715bd856617101be91ba81c346ab8ca903","observation_id":"7d65d4b3-1867-4667-8e84-28734260d52a","resolution":{"observed_at":"2026-08-02T01:52:40.893796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:40.990813Z","title":"Thanks to Vincent Lostanlen for the suggestion of the Haar wavelet baseline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:40.990813Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:4f277c98ad034644267e6bb8e0612ded4fc75126fd79743e889e9361cfcab7ce","observation_id":"14fbeed0-4187-43e4-87e6-c3aa566d0f00","resolution":{"observed_at":"2026-08-02T01:52:40.990813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:41.080408Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.080408Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:888e7dde0a96d1c10a0723c7fbe2b9bf9581a03800634fee724302a7a615244d","observation_id":"d4b316c0-7982-44b7-b16c-cbe021b2800a","resolution":{"observed_at":"2026-08-02T01:52:41.080408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:41.197844Z","title":"Lerdahl and R","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.197844Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:d88889cb0542030d49b8216a06a99a1492b416d168bea5ea05739bc135923fbb","observation_id":"39df41d3-e7c8-4b18-8ead-651b99976abb","resolution":{"observed_at":"2026-08-02T01:52:41.197844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:41.294494Z","title":"CMI-Bench: A comprehensive benchmark for evaluating music instruction following,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.294494Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:2e2212c05e053de3d0137243786ef69007ea5d0b0c65261d910bb4d4143ea468","observation_id":"50bcada1-0973-4f1f-9e93-cfc02066128c","resolution":{"observed_at":"2026-08-02T01:52:41.294494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:41.452519Z","title":"Polyffusion: A diffu- sion model for polyphonic score generation with internal and external controls,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.452519Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:dec405957391f9c83508db7a146c0e37dd6fde3471ed7429d2814ca999de3702","observation_id":"771f3617-0037-426c-a03b-c361d999f8d1","resolution":{"observed_at":"2026-08-02T01:52:41.452519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T01:52:41.532584Z","title":"DINOv2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.532584Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:242638efa591ed4bf582233ec006ac5ee1b517e6026f6db308810e694b009844","observation_id":"96f6f601-084d-4f0b-9cb3-589d53204e97","resolution":{"observed_at":"2026-08-02T01:52:41.532584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:41.603591Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.603591Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:3f77b54caa433f12bc24e96b1e10671591a66d6c4a7112cd9e2de36b829575b5","observation_id":"1c78510a-d1ac-47e6-9aa1-329a27a957da","resolution":{"observed_at":"2026-08-02T01:52:41.603591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-02T01:52:41.654949Z","title":"Diffusion trans- formers with representation autoencoders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.654949Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:3b4517ee6e3daf442e8c4490d0131113647cc57effc9f4db646469b0f1fdc21c","observation_id":"1e0a0565-98a8-429f-95d8-83ad34d4e5dd","resolution":{"observed_at":"2026-08-02T01:52:41.654949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.08544","last_updated":"2025-11-14T08:38:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-11T18:21:55Z","title":"LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.08544","snapshot_observed_at":"2026-08-02T01:52:41.685587Z","title":"LeJEPA: Provable and scalable self-supervised learning without the heuristics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.685587Z"},"links":{"cited_paper":"/paper/2511.08544","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:8697e7f072ffafee5359ed6ff7e4b73eae58b502815bc230f1246320741b5b51","observation_id":"5ef4ed1d-cde9-44d7-bfe5-66c36f288bd7","resolution":{"observed_at":"2026-08-02T01:52:41.685587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:41.731236Z","title":"Emerging properties in self- supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.731236Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:6443ea5f7f9bca9b08e686d78d2823ca334ec9820314b68987f6b68d8081feb3","observation_id":"29e3e19f-401d-47cf-8f6b-aebb6f1026bd","resolution":{"observed_at":"2026-08-02T01:52:41.731236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:41.787479Z","title":"Masked modeling duo: Learning representations by encouraging both networks to model the input,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.787479Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:2a0a6ccdc3ff9962d76f60646e62f7adb0e878c960716e8e8412fc90f6b9d7bd","observation_id":"91e175a9-21f8-4ab3-9311-7dde7ae5763d","resolution":{"observed_at":"2026-08-02T01:52:41.787479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-02T01:52:41.837388Z","title":"V-jepa 2: Self-supervised video models enable understanding, prediction and planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.837388Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:8acd505d023e83871914d8cfced5a0fad0822809b83265ef7bc3a65149b20a32","observation_id":"a3842049-b348-4b85-a135-114e99534aa8","resolution":{"observed_at":"2026-08-02T01:52:41.837388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:41.935167Z","title":"PESTO: Pitch estimation with self-supervised transposition-equivariant objective,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:41.935167Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:07e5753f4487c259881dcdbdc8130dac44f1fe2c24392ac4d4a197396af9e997","observation_id":"fc9d5c98-b04e-4f52-baf1-ee3c9b653927","resolution":{"observed_at":"2026-08-02T01:52:41.935167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.027882Z","title":"Equivariant self-supervision for musical tempo estimation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.027882Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:0709a4fe5470b20924f2cfd01cd575751b2cdc50c31ee93194ab37a1e441edf0","observation_id":"1aec51c0-dbf2-4d31-9c40-cb326d58915a","resolution":{"observed_at":"2026-08-02T01:52:42.027882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.105630Z","title":"STONE: Self-supervised tonality estimator,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.105630Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:225195db2a51832be96cf56aa329e858575d783c11bbabd5602f35f0221372c9","observation_id":"feb42e93-bf68-4793-bd2c-1ba24f40f1fc","resolution":{"observed_at":"2026-08-02T01:52:42.105630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15569","last_updated":"2024-02-23T19:12:41Z","snapshot_observed_at":"2026-07-06T17:34:45.072246Z","submitted_at":"2024-02-23T19:12:41Z","title":"Toward Fully Self-Supervised Multi-Pitch Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15569","snapshot_observed_at":"2026-08-02T01:52:42.166123Z","title":"Toward fully self-supervised multi-pitch estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.166123Z"},"links":{"cited_paper":"/paper/2402.15569","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:598332a883775d12148fc0bbbbda8cc7257261e70836c3f0f6a7bde8f909e42d","observation_id":"641d2545-39a9-4629-9a57-96c87a55b41a","resolution":{"observed_at":"2026-08-02T01:52:42.166123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.224218Z","title":"MusicBERT: Symbolic music understanding with large-scale pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.224218Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:d0e1801a40637bdb4a96a612d47baa06f2972a8a751c26c0620fbb658c328b00","observation_id":"ec5a174c-4aca-4cd4-b8f8-5499e22a514b","resolution":{"observed_at":"2026-08-02T01:52:42.224218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.262424Z","title":"MidiBERT-Piano: Large-scale pre-training for symbolic mu- sic classification tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.262424Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:345b9b17c615188e66c23b951bcd29d9250afb9860055970c71d6da6f1d118af","observation_id":"56816d53-98ab-47c9-b4b3-ecfbf5a5d01d","resolution":{"observed_at":"2026-08-02T01:52:42.262424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.340506Z","title":"MuseBERT: Pre-training music repre- sentation for music understanding and controllable generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.340506Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:84071c95f49983b7a0dfec349c8e8bdc9a0a52946ea519a7825f2bfc04209fcc","observation_id":"3fb6f24a-9bf5-459e-84f8-050c641f1abd","resolution":{"observed_at":"2026-08-02T01:52:42.340506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07142","last_updated":"2020-08-17T08:08:14Z","snapshot_observed_at":"2026-08-06T03:13:15.423488Z","submitted_at":"2020-08-17T08:08:14Z","title":"POP909: A Pop-song Dataset for Music Arrangement Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.07142","snapshot_observed_at":"2026-08-02T01:52:42.411480Z","title":"POP909: A pop-song dataset for music arrangement generation,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.411480Z"},"links":{"cited_paper":"/paper/2008.07142","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:ec77b146eb1ae7ac3178875365b6b07ab9a26e176b23f8cdcb9d609461a199fe","observation_id":"60ceb9bc-a43e-4a1d-a1d1-e8b6a3db9508","resolution":{"observed_at":"2026-08-02T01:52:42.411480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.509357Z","title":"Learning-based methods for comparing sequences, with applications to audio-to-MIDI alignment and matching,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.509357Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:cb1b3a142b7eafa02934db14b92a782c0efd94a158429a496ddb6b2b463b7ec5","observation_id":"9c696266-0819-4297-8eda-414a2a47e1af","resolution":{"observed_at":"2026-08-02T01:52:42.509357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.602238Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.602238Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:a442752e8c0fd749a34ef484e4573c1e0b23ac1cab967fe6774713c4d176baf8","observation_id":"0913c3a2-8f0c-4907-b9ac-d5278c0c2602","resolution":{"observed_at":"2026-08-02T01:52:42.602238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.676202Z","title":"Swin transformer V2: Scaling up capacity and resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.676202Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:a456f2f13ca60add816d5a77c33731450f30f1a55687d0825fd10a4dd7baf8f2","observation_id":"dd5c211e-632a-4458-8980-3348d351b272","resolution":{"observed_at":"2026-08-02T01:52:42.676202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10738","last_updated":"2023-09-20T10:56:07Z","snapshot_observed_at":"2026-08-07T09:52:59.812138Z","submitted_at":"2023-09-19T16:34:24Z","title":"MelodyGLM: Multi-task Pre-training for Symbolic Melody Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10738","snapshot_observed_at":"2026-08-02T01:52:42.741422Z","title":"MelodyGLM: Multi-task pre- training for symbolic melody generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.741422Z"},"links":{"cited_paper":"/paper/2309.10738","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:6bca77fc8835ce2fd80e71fa4bf3ea0e1718970f5fc28ea3d5bf6bedf1cafcc7","observation_id":"bf195eac-2a4a-45a3-a642-9bcb54505338","resolution":{"observed_at":"2026-08-02T01:52:42.741422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01291","last_updated":"2020-08-04T02:49:57Z","snapshot_observed_at":"2026-08-09T21:50:13.603000Z","submitted_at":"2020-08-04T02:49:57Z","title":"Music SketchNet: Controllable Music Generation via Factorized Representations of Pitch and Rhythm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.01291","snapshot_observed_at":"2026-08-02T01:52:42.838256Z","title":"Music SketchNet: Control- lable music generation via factorized representations of pitch and rhythm,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.838256Z"},"links":{"cited_paper":"/paper/2008.01291","citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:8b222e7a16caec8d19a3baca0313840d404981e0a1620f1e7aa130ec0724eb61","observation_id":"c1dd8008-2c85-4e2c-97b2-6e87609b03f3","resolution":{"observed_at":"2026-08-02T01:52:42.838256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.929370Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.929370Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:c3879ce56b41b7fd2799a7aa224f43f032b9267ed53216bff30844bc7e64528d","observation_id":"12b3eab7-47ac-45db-85e2-b98185d64ac8","resolution":{"observed_at":"2026-08-02T01:52:42.929370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:42.971121Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:42.971121Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:846b6d9c6f6e8ceed07a93f362b4e2b56a30d9d873e768f5fc88d22e02e6edd2","observation_id":"b451ec46-16b4-4739-ab56-ec513128d2ca","resolution":{"observed_at":"2026-08-02T01:52:42.971121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:43.059461Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:43.059461Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:fe970e23bfcd87aa27b5f0376616d6dec3f59beab0996188df8b3527cb29ed3d","observation_id":"9d15d1d9-318a-4ae1-a99f-40ca071cea23","resolution":{"observed_at":"2026-08-02T01:52:43.059461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:43.150833Z","title":"EMOPIA: A multi-modal pop piano dataset for emo- tion recognition and emotion-based music generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:43.150833Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:e0bf0248ec7d7e250774bcf3ce50020163e0385b50b1201c6eda567926842a95","observation_id":"0f5002f7-132f-410f-bb39-efa7556d1dc0","resolution":{"observed_at":"2026-08-02T01:52:43.150833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:52:43.212465Z","title":"Unsupervised deep haar scattering on graphs,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:52:43.212465Z"},"links":{"citing_paper":"/paper/2607.14537"},"observation_digest":"sha256:d25a03bfe60b08b44b54b139d186ac381e859d83d93ade6655638a2f5329f118","observation_id":"08f58d55-d2ca-4df4-ab93-88342e119122","resolution":{"observed_at":"2026-08-02T01:52:43.212465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14537","last_updated":"2026-07-16T03:42:35Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T04:00:51.069904Z","submitted_at":"2026-07-16T03:42:35Z","title":"MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2607.14537."}