{"as_of":"2026-08-09T20:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac5267dc1d03bbe4488773f2e733fee769aef94ed1ff4f700b9f4d38dd20c9cd","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:42:37.133267Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04378/citation-record","integrity":"/paper/2608.04378/integrity","json":"/paper/2608.04378/citation-record.json","paper":"/paper/2608.04378"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.075440Z","title":"Self-supervised learning from images with a joint- embedding predictive architecture","venue":null,"work_id":"c4c02609-c903-4ec6-83dc-e593e9eb44ed","year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.912135Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:7d1b9746b872e9a10d15b7bd0cfe1e9fe31d0d5ab5b06782b8ba7313f5d38d2f","observation_id":"0a8874bf-1f7d-4649-9a84-57fa7402b568","resolution":{"observed_at":"2026-08-08T18:42:38.080911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.059125Z","title":"LeJEPA: Provable and scalable self-supervised learning without the heuristics, 2025","venue":null,"work_id":"36f15944-7f3f-42ff-a6bf-af43842abf2f","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.918353Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:c3990e395c18b0161bd40780d4a47b830b7a8ed42b7080b22e024cde6e7f72cb","observation_id":"87ab2416-fe04-4adf-a606-c7d2920dc467","resolution":{"observed_at":"2026-08-08T18:42:38.063959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.043803Z","title":"Bittner, Juan José Bosch, David Rubinstein, Gabriel Meseguer-Brocal, and Sebastian Ewert","venue":null,"work_id":"e5b12699-9eea-49b4-a86e-73e4bde7e4a4","year":2022},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.923728Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:9550ee8a1bde8c5f62b7896c0d455464898b2f2a30dd37da9b488bd0fe278618","observation_id":"f0ce2832-a2bc-4771-a2d8-30745e4a1e7d","resolution":{"observed_at":"2026-08-08T18:42:38.048869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.027345Z","title":"Zapata, and Xavier Serra","venue":null,"work_id":"6c74b383-b716-49d2-9aac-af28e57cd0d5","year":2013},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.929545Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:bb1745c52af02d0cc4be54bf13576bbefa95cc894be06ae96b7fc8c4d5338bba","observation_id":"2cf73a05-3977-49d2-80f3-fc2571c3f015","resolution":{"observed_at":"2026-08-08T18:42:38.032439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:38.012377Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"14e07cfa-0d65-45b6-a4dd-1ffba4f390b0","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.934794Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:4dc9acf6b98021dec926cf39b52b33b3ed6fefb36f172fb34f05a0bce4035f48","observation_id":"8ab0eeaf-e0d4-4b3c-90ec-aca0412ce320","resolution":{"observed_at":"2026-08-08T18:42:38.017269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.996570Z","title":"Codified audio language modeling learns useful representations for music information retrieval","venue":null,"work_id":"2646d8dc-4a18-41b5-944d-266e8730df1c","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.939949Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:706bac52bd1f1baceeea5edd21c25a80aa74571f001310938e0707a77d33047c","observation_id":"59777f34-56c3-4d60-b615-a86b8be63621","resolution":{"observed_at":"2026-08-08T18:42:38.001701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01291","last_updated":"2020-08-04T02:49:57Z","snapshot_observed_at":"2026-08-07T23:54:39.263177Z","submitted_at":"2020-08-04T02:49:57Z","title":"Music SketchNet: Controllable Music Generation via Factorized Representations of Pitch and Rhythm","version":1},"cited_work":{"arxiv_id":"2008.01291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.01291","snapshot_observed_at":"2026-08-08T18:42:37.563154Z","title":"Music SketchNet: Controllable Music Generation via Factorized Representations of Pitch and Rhythm","venue":"cs.LG","work_id":"e041a8a7-8840-4b36-9ba3-5a52fb2cfa71","year":2020},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.945515Z"},"links":{"cited_paper":"/paper/2008.01291","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:b0dd708f1254cce0f620d8ee6068b0ac3e74e753422481033cb6717687cecf47","observation_id":"5c3baffb-2a94-4a1e-8893-96df08d80ae6","resolution":{"observed_at":"2026-08-08T18:42:37.568953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:36.950691Z","title":"Pixelflow: Pixel-space generative models with flow, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.950691Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:6178496b0b50fdfebcd468e5bb9818f50666dc2a5253fede36a5ffcb1033e68e","observation_id":"8b25a6df-49bf-4ad7-9374-fec2b95402df","resolution":{"observed_at":"2026-08-08T18:42:36.950691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07518","last_updated":"2020-10-15T04:52:02Z","snapshot_observed_at":"2026-08-09T03:59:11.933739Z","submitted_at":"2020-10-15T04:52:02Z","title":"Automatic Analysis and Influence of Hierarchical Structure on Melody, Rhythm and Harmony in Popular Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07518","snapshot_observed_at":"2026-08-08T18:42:36.955570Z","title":"Dannenberg","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.955570Z"},"links":{"cited_paper":"/paper/2010.07518","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:3afd9a6a851634ac75b8a3a976bf91da74494735de956c4edfcdb55f9d12a551","observation_id":"b76b3215-d6ea-4ee0-a166-f468f897a65c","resolution":{"observed_at":"2026-08-08T18:42:36.955570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.971805Z","title":"Diffusion models beat GANs on image synthesis","venue":null,"work_id":"8d708bb6-f68a-4fbc-9c6e-c454451031bd","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.960678Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:71dc01f32d23094035d0179752ea6ee18c53b0aa79bb1be2d31349796b0c8dc1","observation_id":"0872e412-f945-466a-b80e-e54c31e0fc54","resolution":{"observed_at":"2026-08-08T18:42:37.976481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.957299Z","title":"Generative modelling in latent space, 2025","venue":null,"work_id":"072aed86-466c-457f-bb5a-49e4897d9d8d","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.965421Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:ccae5642aa1f78b3485e9d6865c871e1b093fcd591550c93404174d20c8dcdda","observation_id":"99673cb7-a190-4952-9601-3eaf6166e80b","resolution":{"observed_at":"2026-08-08T18:42:37.962049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.941503Z","title":"Hawley, and Jordi Pons","venue":null,"work_id":"4998d3a8-f03a-4ef7-8ba2-324f4f70aac8","year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.970418Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:bca6e27c11ab04616ec71f7518d0dd02f75dd4f318a57a9d651b6588abbc1fda","observation_id":"ee53d3be-8918-411f-a66a-0973ca62549c","resolution":{"observed_at":"2026-08-08T18:42:37.946586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00504","last_updated":"2024-03-01T13:05:38Z","snapshot_observed_at":"2026-07-06T17:38:04.972649Z","submitted_at":"2024-03-01T13:05:38Z","title":"Learning and Leveraging World Models in Visual Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00504","snapshot_observed_at":"2026-08-08T18:42:36.975241Z","title":"Learning and leveraging world models in visual representation learning.arXiv preprint arXiv:2403.00504, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.975241Z"},"links":{"cited_paper":"/paper/2403.00504","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:60e6af4ac9f0902266478ecfa12dbd224d8effd27b23e3dfa8f119fa4987cd05","observation_id":"ec1dd9e5-264d-4417-b06f-3f8a9553fca9","resolution":{"observed_at":"2026-08-08T18:42:36.975241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-08T18:42:36.980422Z","title":"World models.arXiv preprint arXiv:1803.10122, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.980422Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:03ef7f921a25702415acebc88d281f7049e250fe9d50cc1c9eb8c7b6cd411e05","observation_id":"823ffb86-9a19-46ce-8fac-aed9cf3d4be2","resolution":{"observed_at":"2026-08-08T18:42:36.980422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.924949Z","title":"Using a joint-embedding predictive architecture for symbolic music understanding","venue":null,"work_id":"8941ad10-8466-4c06-9aaa-b6dff5737b81","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.985406Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:e13b10d0463073416da57c8d52503ee35c2b1accc1af255e0522e01e0c7471e0","observation_id":"19e4507f-3ca4-4b83-985a-1df8eaaef8b7","resolution":{"observed_at":"2026-08-08T18:42:37.929987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.909028Z","title":null,"venue":null,"work_id":"8b255566-87a6-435b-a647-536125afe9c6","year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.990376Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:0fbc886284d9ce5f1d6423df08e4652deb4e813089e31d9b2f4b2af90dd39373","observation_id":"2a4bf12f-9026-413b-a7da-0e8174363d51","resolution":{"observed_at":"2026-08-08T18:42:37.914256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.893416Z","title":null,"venue":null,"work_id":"6d593ee8-6e8d-4b9e-81f7-1a4e8400cf3c","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:36.995429Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:ebdaffc2e37acf9fd845b38072d012bacb7ed47ad27339de4771fdd9bfc60455","observation_id":"dcf967d7-5d7b-4c45-9c3f-0b29962cccbf","resolution":{"observed_at":"2026-08-08T18:42:37.898382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.877839Z","title":"EMOPIA: A multi-modal pop piano dataset for emotion recognition and emotion-based music generation","venue":null,"work_id":"b6ca3bf3-d69a-4561-a4a1-e09ea07d026e","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.000539Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:d9b00206414e66656c778bc29df5a30401b36b59eae81f962bf316e706b3207a","observation_id":"58bff056-ca19-4e5f-94e5-a646e70108bd","resolution":{"observed_at":"2026-08-08T18:42:37.882781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.005741Z","title":"How far can pretrained LLMs go in symbolic music? controlled comparisons of supervised and preference- based adaptation.arXiv preprint arXiv:2601.22764, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.005741Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:03d5eae0b7b0360db69896e599a876d9236c902a2b96329f5e6a6e994f2bc96e","observation_id":"776a0ebf-080a-4d0b-bcc9-900b302cffdc","resolution":{"observed_at":"2026-08-08T18:42:37.005741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.861917Z","title":"A path towards autonomous machine intelligence.OpenReview preprint, 2022","venue":null,"work_id":"202828c7-c54c-4ef0-ba2d-9488eaa42ff6","year":2022},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.010781Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:9cf431de28430438ee9aa2312bb0ea8f8f2f7e6de548d22fc876aff90143a31d","observation_id":"cb009084-0471-46a6-918f-b6819232b411","resolution":{"observed_at":"2026-08-08T18:42:37.867340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.015774Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.015774Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:ce126452d8c0f9a5af09431c944b1f1bb25e8d1e947b07dfe916626f50b1d39f","observation_id":"df7df0f6-71f8-4b7f-92f3-da69e35974af","resolution":{"observed_at":"2026-08-08T18:42:37.015774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.836956Z","title":"Swin transformer V2: Scaling up capacity and resolution","venue":null,"work_id":"ed93210c-d926-43d3-af06-99488f12dd20","year":2022},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.020732Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:9de08dcb703d1a508fbecca110d8d7259b147adf80a4026db77cf00b0269cd54","observation_id":"ed68fb50-386a-41f0-9356-2fe0385ab834","resolution":{"observed_at":"2026-08-08T18:42:37.841633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.820668Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"961c9d15-4c76-421f-835b-4bd407d37a2c","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.026096Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:7d60e3ec593a16021d9ff7c98908ac65c08ebf9c367f2b7e51379ba6f9d631e1","observation_id":"23e7dc7b-507c-4dab-86b3-6699f2f59d6f","resolution":{"observed_at":"2026-08-08T18:42:37.826192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.804572Z","title":"One-step latent-free image generation with pixel mean flows, 2026","venue":null,"work_id":"1ccc2fb8-3f2f-48da-b249-e7c86453cbc9","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.031151Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:582d3f2b21582e6830552c8581add6322e8c930caa3f2f82f2beba3e0646590b","observation_id":"f4fec9ca-7df3-44f8-9754-a72c49232f45","resolution":{"observed_at":"2026-08-08T18:42:37.809553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.789090Z","title":"CMI-Bench: A comprehensive benchmark for evaluating music instruction following","venue":null,"work_id":"cf17ce30-e12e-4624-b519-641adc308eac","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.036013Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:6330ef167bdef39b0f9ce72bd5a2d2d51e28c4d39adff55d9655f351926dbb5f","observation_id":"2d36acc3-76b4-4d96-a9b7-a0d8875d630b","resolution":{"observed_at":"2026-08-08T18:42:37.794140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.773140Z","title":"Pnp-flow: Plug-and-play image restoration with flow matching","venue":null,"work_id":"31ff9c23-afb9-4d45-80d7-ed50d10a25ad","year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.040895Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:382879df43b1277d017168c564ab7dded2686515bb34eaec35aa095233c1bd60","observation_id":"75e79708-a7b9-4776-8996-3be58b18a4d3","resolution":{"observed_at":"2026-08-08T18:42:37.778168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.758193Z","title":null,"venue":null,"work_id":"de7c8d9e-f927-4592-abf2-1bf3e9808905","year":2015},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.045834Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:1f28a11d4ccc2b9e725d3b7e8175d6fd7058856d7750ad971fec66c332f12bde","observation_id":"85c8f97e-4f54-4634-8f48-c8cedf74184f","resolution":{"observed_at":"2026-08-08T18:42:37.762821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.742210Z","title":"Polyffusion: A diffusion model for polyphonic score generation with internal and external controls","venue":null,"work_id":"30b094ff-563f-4e84-b9e7-e29d8c30e81b","year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.050886Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:50a13d450db8d0666dfe89598ee4b0eecd5d69c27474888a479d4bdb89a100de","observation_id":"134e1ddc-edaa-47a2-b3c8-48fd902bb68c","resolution":{"observed_at":"2026-08-08T18:42:37.747648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-08T18:42:37.055751Z","title":"DINOv2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.055751Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:e59918ce334712967a53706f8642243a0b4f76ad1a18c4a3b25cf1b4207ebcbd","observation_id":"c8146f13-b4f8-4ba4-a32e-9f4b3cf33c60","resolution":{"observed_at":"2026-08-08T18:42:37.055751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.060824Z","title":"Muckley, Ricky T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.060824Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:ad5d3e87c131eaa8c64ca8025a29b32af01e327027dcdec5e5b8dbecc11adcf1","observation_id":"cc2dee26-7156-484b-99a7-ad1273520a00","resolution":{"observed_at":"2026-08-08T18:42:37.060824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.715597Z","title":"PhD thesis, Columbia University, 2016","venue":null,"work_id":"d0422f01-86d6-4f2d-be97-6acba648c857","year":2016},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.065674Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:3a9b9c1f5d265cb85dee6a6c83731db1fbcff1ba876e475990e25b3c9e2d110a","observation_id":"40c9a460-054b-4def-828c-bc6a56b1a33e","resolution":{"observed_at":"2026-08-08T18:42:37.720976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.698747Z","title":"Stem- JEPA: A joint-embedding predictive architecture for musical stem compatibility estimation","venue":null,"work_id":"643072ce-3608-4339-a24b-774c877d4d29","year":2024},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.070460Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:3ebc80106b1af2184e3adf4e8946d56f1d86b401202bb04663ff603e0253a3f5","observation_id":"223d6f9e-ba15-4769-9dcd-69218455e90f","resolution":{"observed_at":"2026-08-08T18:42:37.703918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.683461Z","title":"Crash: Raw audio score-based generative modeling for controllable high-resolution drum sound synthesis, 2021","venue":null,"work_id":"cd39e895-0f92-4cbb-aed2-fc7c280f1c28","year":2021},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.075034Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:d9839bffd8d70f4e6a0f1402a93785003f7002abde471eb91af5ca03c1835b07","observation_id":"0f15c106-a328-41bd-89bd-081b0e7f38c1","resolution":{"observed_at":"2026-08-08T18:42:37.688676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.668092Z","title":"Muscriptor: An open model for multi-instrument music transcription, 2026","venue":null,"work_id":"1af595cb-b16e-47fb-8325-b820f8f63280","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.079711Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:95b092eb3965362c130de55fe7c39956c007f65fafd9d046ea07cc069c83d817","observation_id":"6bb44a12-d538-46b4-8001-cd46248a1f9f","resolution":{"observed_at":"2026-08-08T18:42:37.673242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.650758Z","title":"Rick Rubin: The 60 minutes interview.60 Minutes, CBS News","venue":null,"work_id":"418571db-7a67-40d9-82ae-4fa1b215ed54","year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.084436Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:0d6f5029d27b9abb697fa40110e46f12ea0965d925eba4c9036f250f4c8a779c","observation_id":"c226ce58-bccb-4284-878e-3145fae4044d","resolution":{"observed_at":"2026-08-08T18:42:37.655671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.635007Z","title":null,"venue":null,"work_id":"3b29ba26-a162-46cc-8fa6-b49857163e3d","year":2022},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.089482Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:a3b158a75a6ab371c02e7f9e2c0232851b81d91525ad29ad900df64b100bf4fd","observation_id":"2c5f8fec-afaa-4ae4-a232-96c8a90cf810","resolution":{"observed_at":"2026-08-08T18:42:37.640139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.093962Z","title":"Improving and generalizing flow-based genera- tive models with minibatch optimal transport.Transactions on Machine Learning Research,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.093962Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:623d023938b4480a7056c6359b3ff1ea66e47b81015a483cca02a5ccc7544808","observation_id":"36cb00f1-254e-4088-8729-14943ecbb7c7","resolution":{"observed_at":"2026-08-08T18:42:37.093962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.596311Z","title":"Music-JEPA: Learning a world model of sound from action, 2026","venue":null,"work_id":"384b634c-1128-466f-b043-a1728ccb44ef","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.104016Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:2a95f67c9b52329873b955d292e01dfa509638c681d4fe6c02ac161b623bcb33","observation_id":"ab69694a-1cbf-45f4-b5c5-310b296da0c0","resolution":{"observed_at":"2026-08-08T18:42:37.601766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.579877Z","title":"Visreg: Variance-invariance-sketching regularization for jepa training, 2026","venue":null,"work_id":"692d6f02-7b28-460a-8373-605958d8f109","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.108727Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:7546304bd06ec6b86e17a0d7f1520e5d6dadc0f71425ffca2b205596d6e30be5","observation_id":"ef97b942-4dd2-4979-ba95-68a7039b397d","resolution":{"observed_at":"2026-08-08T18:42:37.585245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10738","last_updated":"2023-09-20T10:56:07Z","snapshot_observed_at":"2026-08-07T09:52:59.812138Z","submitted_at":"2023-09-19T16:34:24Z","title":"MelodyGLM: Multi-task Pre-training for Symbolic Melody Generation","version":2},"cited_work":{"arxiv_id":"2309.10738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.10738","snapshot_observed_at":"2026-08-08T18:42:37.403158Z","title":"MelodyGLM: Multi-task Pre-training for Symbolic Melody Generation","venue":"cs.SD","work_id":"485a5565-62b8-4e53-a55a-9d975ffee400","year":2023},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.113557Z"},"links":{"cited_paper":"/paper/2309.10738","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:70aa353988e668ba6fe2a9da31ed5a061bea7dfce9cbb44fd066b03cc7feb380","observation_id":"d4332ef1-0b75-4283-a70f-c45e98a78200","resolution":{"observed_at":"2026-08-08T18:42:37.410262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21740","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.378931Z","title":"MIDI-LLaMA: An instruction-following multimodal LLM for symbolic music understanding.arXiv preprint arXiv:2601.21740, 2026","venue":null,"work_id":"35e7e6de-0303-4a09-b775-f7927ad17a9c","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.118857Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:cb2c6a70d31bc3bcf04d13cc9af23058c7553dbfb24dfa605d094d14a2a5477c","observation_id":"8564d54c-c355-4bf7-ade4-163d2526236d","resolution":{"observed_at":"2026-08-08T18:42:37.387019Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.10003","last_updated":"2026-07-10T22:02:00Z","snapshot_observed_at":"2026-08-09T17:04:53.257364Z","submitted_at":"2026-07-10T22:02:00Z","title":"ARIMA: Reconstruction-Grounded Predictive Representation Learning for Symbolic Music","version":1},"cited_work":{"arxiv_id":"2607.10003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.10003","snapshot_observed_at":"2026-08-08T18:42:37.302502Z","title":"ARIMA: Reconstruction-Grounded Predictive Representation Learning for Symbolic Music","venue":"cs.SD","work_id":"3d3a7920-dc6d-4cd0-a938-060541d19317","year":2026},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.123392Z"},"links":{"cited_paper":"/paper/2607.10003","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:9b95c6fef496e87e58a7dda773318ad524c65567c7070be68b185f02829a4205","observation_id":"b90d367e-3164-4d36-a123-753077ee38f0","resolution":{"observed_at":"2026-08-08T18:42:37.310363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.128449Z","title":"ABC-Eval: Benchmarking large language models on symbolic music understanding and instruction following.arXiv preprint arXiv:2509.23350, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.128449Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:9cb143488c86c16f0f2e40630b352dae6a99d93c1f26320d9c1ed9c287b9777c","observation_id":"d31e8fa0-d1c7-49c7-bad9-438cbb904560","resolution":{"observed_at":"2026-08-08T18:42:37.128449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-07-06T22:32:32.632779Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-08T18:42:37.133267Z","title":"/all”; values = best across levels, one consistent probe-suite vintage; “/all","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.133267Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:bd396630517a01ae192289ab52f65413cb5dd9608d38f27eb4117a5d5729f116","observation_id":"9c36c57d-20fb-411d-b5cc-6c78bc1b0432","resolution":{"observed_at":"2026-08-08T18:42:37.133267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:42:37.099100Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T18:42:37.099100Z"},"links":{"citing_paper":"/paper/2608.04378"},"observation_digest":"sha256:667b2df0c8db310a557da35c59556d5feb92c96baa915927a8660f7720799f16","observation_id":"c4c16f69-7feb-45d3-b797-efdfae11cf75","resolution":{"observed_at":"2026-08-08T18:42:37.099100Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04378","last_updated":"2026-08-05T02:38:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T03:59:51.044695Z","submitted_at":"2026-08-05T02:38:20Z","title":"Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":15,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2608.04378."}