{"as_of":"2026-08-05T12:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23e5a2bf58ee8e196405e720e8cf7c246802b959a87da40f0c6446ba83543ccb","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T23:33:11.565375Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.05350/citation-record","integrity":"/paper/2511.05350/integrity","json":"/paper/2511.05350/citation-record.json","paper":"/paper/2511.05350"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.250246Z","title":"Meaning in music and information theory.The Journal of Aesthetics and Art Criticism, 15(4):412–424, 1957","venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.250246Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:12a60996ccd7ff450ea32fff0b38f8316d991c683f31137f002710d862b9e4b1","observation_id":"cd1de54f-3780-49c2-bf4f-677a782af7f7","resolution":{"observed_at":"2026-08-03T23:33:06.250246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.333975Z","title":"Multiple viewpoint systems for music prediction.Journal of New Music Research, 24(1):51–73, 1995","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.333975Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:e90aeff79490afcca2b198dbaa75797b7a7b784f12dc4ec24665e37a89c0fca0","observation_id":"4510bd53-fe99-49b8-aed2-4d2fb96bdfe9","resolution":{"observed_at":"2026-08-03T23:33:06.333975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.387106Z","title":"PhD thesis, Department of Computing, City University, London, UK, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.387106Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:0b338e831503c9cb44ae9311703c6a03299abb71b522b833e557059b1b2b96aa","observation_id":"05bc1cf5-ff22-4536-a836-f5600a76fa22","resolution":{"observed_at":"2026-08-03T23:33:06.387106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.448317Z","title":"Controlling surprisal in music generation via information content curve matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.448317Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:71d5f2589187930e5dc2e404ae6d4bd959fc2b451c0c4b27f0013555da46e19c","observation_id":"947aaaa6-25b3-466c-98c6-6c3f3fda2d63","resolution":{"observed_at":"2026-08-03T23:33:06.448317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.503354Z","title":"Estimating musical surprisal in audio","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.503354Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:70e31c8a4575a8591154bc19edab396ab04a5685089e642e270a048a3a6ee4e4","observation_id":"8d524c0f-ec89-42af-8a42-67b0f9d44957","resolution":{"observed_at":"2026-08-03T23:33:06.503354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.582246Z","title":"Unsupervised statistical learning underpins computational, behavioural, and neural manifestations of musical expectation.NeuroImage, 50(1):302–313, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.582246Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:177e52f350b6dc6b2e705f28c2ae8d3b76362bce60cf26fe65d2b01e0a686a0b","observation_id":"e0374b48-53dc-4b53-b333-b64949fdb5c9","resolution":{"observed_at":"2026-08-03T23:33:06.582246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.643112Z","title":"Cortical encoding of melodic expectations in human temporal cortex.Elife, 9:e51784, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.643112Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:c734654e2d65d1ca16bf60f3a3d6b29573187bfa6e398ce8457ad423f466050e","observation_id":"976dc0ae-2851-4291-8b43-2bc250b1f388","resolution":{"observed_at":"2026-08-03T23:33:06.643112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.668490Z","title":"Predictive uncertainty in auditory sequence processing","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.668490Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:03de4855f06e752c0f58f06c773ac2fe4bb8554f528334b4a237ae15b792d3dd","observation_id":"bfba25cd-0665-4e64-b200-f492e33b6971","resolution":{"observed_at":"2026-08-03T23:33:06.668490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.693945Z","title":"Pupil responses to pitch deviants reflect predictability of melodic sequences.Brain and Cognition, 138:103621, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.693945Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:40978751379b5189311f9df8d0eafb52df5d09532b82f826cbda9700b35af329","observation_id":"4f69221b-2629-4fe2-8e91-31fc94c578c8","resolution":{"observed_at":"2026-08-03T23:33:06.693945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.857630Z","title":"Statistical learning of melodic patterns influences the brain’s response to wrong notes.Journal of cognitive neuroscience, 29 (12):2114–2122, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.857630Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:36d9456b70d1cd451530e18e45398cff5631f25ac484fdacf39c71f1cb958b6c","observation_id":"28f36de8-79b8-4eb8-8135-7731e7eb1016","resolution":{"observed_at":"2026-08-03T23:33:06.857630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:06.962287Z","title":"Detecting change in stochastic sound sequences","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:06.962287Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:f8541b406eb0f57726d9f32491fe84806e7ba4699a6ec5d5291378ee3d195d0f","observation_id":"9381a601-1d50-46b6-b854-5e6bca2ed43e","resolution":{"observed_at":"2026-08-03T23:33:06.962287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:07.110511Z","title":"A model for statistical regularity extraction from dynamic sounds.Acta Acustica united with Acustica, 105(1):1–4, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:07.110511Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:68afbca3734bcc35a40e96b67f78caa0f0519fdf1665928cda93d91a579271b2","observation_id":"87749f55-d5e7-4fee-afd4-803a073c1e77","resolution":{"observed_at":"2026-08-03T23:33:07.110511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:07.196138Z","title":"Estimating musical surprisal from audio in autoregressive diffusion model noise spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:07.196138Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:3e5bce9057ddf118da6ad47ecd8a8031f835abd5fa738f316153c029a5ae73d0","observation_id":"03a03fbd-29b3-4453-918c-b0842ff03dcc","resolution":{"observed_at":"2026-08-03T23:33:07.196138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:07.360974Z","title":"Diffusion is spectral autoregression, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:07.360974Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:e07849b6389e12f96a1639e668aa316cb4f0a3e02fc4a404b388dec78da9cf2b","observation_id":"47163857-8412-4861-a609-f675bb86518e","resolution":{"observed_at":"2026-08-03T23:33:07.360974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11278","last_updated":"2025-05-16T14:13:02Z","snapshot_observed_at":"2026-08-02T17:50:58.807019Z","submitted_at":"2025-05-16T14:13:02Z","title":"A Fourier Space Perspective on Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11278","snapshot_observed_at":"2026-08-03T23:33:07.467555Z","title":"Turner, Edward Meeds, Javier Zazo, and Sushrut Karmalkar","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:07.467555Z"},"links":{"cited_paper":"/paper/2505.11278","citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:24ad3ea8b630dbcfe93cf5391a7c1ac1551ec681ec414c4e100eda7708f1742d","observation_id":"492e598c-dad5-48b8-bbb3-8c7f9a5cb20f","resolution":{"observed_at":"2026-08-03T23:33:07.467555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:07.590998Z","title":"Latent denoising makes good visual tokenizers.arXiv preprint arXiv:2507.15856, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:07.590998Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:26ed1a6a09309a78c7e232494bf37482c5d912b07cb7de700e4c24ed6b2a1c8c","observation_id":"a065e55e-cf1b-48d9-9910-c1c801c4453a","resolution":{"observed_at":"2026-08-03T23:33:07.590998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:07.749343Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:07.749343Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:f306bdd100f1059396db8f137ae61c481e5d2cb7a8f183800dd862b9b84a79ff","observation_id":"c3b0e606-5c4f-4573-854b-8258354b2dad","resolution":{"observed_at":"2026-08-03T23:33:07.749343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:07.910282Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:07.910282Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:ef64873b5a3592a9069052999caae06d101a6bd9ad13676c480d1edc4ca48f11","observation_id":"4ed766a7-b324-4bf4-9c4c-7e4a1d2e5963","resolution":{"observed_at":"2026-08-03T23:33:07.910282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:08.014255Z","title":"Music2latent: Consistency autoencoders for latent audio compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:08.014255Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:d764c6f14cc23c090db95d610b6637ccee4b567fe451c2240b15732b746a3b63","observation_id":"f2fe698b-1819-4232-8823-3a31e669e8b5","resolution":{"observed_at":"2026-08-03T23:33:08.014255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:08.124102Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:08.124102Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:4e6867d45be19034d811e6fd6add42963da66604baed0fdb5cb4bc00cac6797a","observation_id":"eedb06ba-c350-44ea-87cb-8702c6703c80","resolution":{"observed_at":"2026-08-03T23:33:08.124102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:08.270765Z","title":"Speech enhancement and dereverberation with diffusion-based generative models.IEEE ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:08.270765Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:d4ec96ebe9bc4d608fc916e150cbe468122944c48ced23e60edae4c310428028","observation_id":"3d760490-cc41-4f5e-9142-f7080a922354","resolution":{"observed_at":"2026-08-03T23:33:08.270765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:08.368232Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:08.368232Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:95f9137cfade79dea23403350af5d8ac9dbe95751114417384aee843f3e90ffd","observation_id":"20564765-677e-4078-a178-00f185711bf6","resolution":{"observed_at":"2026-08-03T23:33:08.368232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:08.511189Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:08.511189Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:c5d5aa2211f0f8a5d3b72eed570954b2aacc1b092eba8fa7d58313b5eac0ef6c","observation_id":"1d864324-35a5-4872-a9ae-e3aa470c38e4","resolution":{"observed_at":"2026-08-03T23:33:08.511189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:08.674261Z","title":"Continuous autoregressive models with noise augmentation avoid error accumulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:08.674261Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:681e0364028213f16695c68c23f11e554c8c3dc10554e6b89802f2ff630ca4f1","observation_id":"11edc7b0-6381-4dc9-912d-b479d154337b","resolution":{"observed_at":"2026-08-03T23:33:08.674261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:08.904599Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:08.904599Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:699204699fb8f7c81a36a0dfaa9c3c864f57458c62d3643e6baa8f1fdea6232a","observation_id":"7d39d037-df4a-4581-a750-94bf6b4deaed","resolution":{"observed_at":"2026-08-03T23:33:08.904599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:09.073317Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:09.073317Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:b5fa1718a68222734ce8f7e7058113e3bfc037f184702130ec5cba3ee0784416","observation_id":"40181827-e536-4c6c-82c3-a8db959dfcbd","resolution":{"observed_at":"2026-08-03T23:33:09.073317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:09.239481Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:09.239481Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:00e70002cc44fc9564de99bfa576b1e04682dd965272aae8937d2a5788d50274","observation_id":"8bf0656b-3970-4e2c-8420-568440a565b3","resolution":{"observed_at":"2026-08-03T23:33:09.239481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:09.485256Z","title":"Neural ordinary differential equations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:09.485256Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:2f224c575b1ea94b487f1ed90083b6328ed520622a0ef0f298161a7d0bdd6afe","observation_id":"f96414e3-18dd-45a2-8715-4238f0dccc84","resolution":{"observed_at":"2026-08-03T23:33:09.485256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-03T23:33:09.657600Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:09.657600Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:954f59411b0c5315cf4d5dab8a58666d881204dfd05d941ccc3dfc4adfbc215d","observation_id":"ed502abf-241e-4314-8c05-fecf7ebd23e1","resolution":{"observed_at":"2026-08-03T23:33:09.657600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:09.823249Z","title":"Logistic-normal distributions: Some properties and uses","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:09.823249Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:ce8efea551560d60a098dd4ffaaf41c72b6cb14334fc5727cb09ceb8a694125e","observation_id":"45a06459-c2be-4fcc-8dc3-70b1fe67afa1","resolution":{"observed_at":"2026-08-03T23:33:09.823249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:09.935972Z","title":"Visqol: an objective speech quality model.EURASIP Journal on Audio, Speech, and Music Processing, 2015(1):13, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:09.935972Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:69478396a33dd0f8f21554d7103c97f5a45e3a8cabad6e7d463aa40ac9ea4e84","observation_id":"033e9867-cd4e-45a5-8495-a92821c4550e","resolution":{"observed_at":"2026-08-03T23:33:09.935972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:10.162465Z","title":"Objective assessment of perceptual audio quality using visqolaudio.IEEE Transactions on Broadcasting, 63(4):693–705, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:10.162465Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:7c936d3cba8c5b28da76967b56808406e9bebd31cd323b634f44a766b4c2ef14","observation_id":"3fe5d33f-76f9-40e3-b52e-2177b4331d9b","resolution":{"observed_at":"2026-08-03T23:33:10.162465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:10.402184Z","title":"Visqol v3: An open source production ready objective speech and audio metric","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:10.402184Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:046f903193c1972f12244aff9f1a2df1376765549211f414636544cf7dc83b35","observation_id":"3520ac7a-bea9-4211-a597-000b39e69e10","resolution":{"observed_at":"2026-08-03T23:33:10.402184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:10.599346Z","title":"Sdr–half-baked or well done? InICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 626–630","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:10.599346Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:a7a67d635036f5a91ff6b64ed57fe959fabaceceef4379c614d27e9ca9dc4f94","observation_id":"5a2cde82-250c-484a-be9e-7e55182144b3","resolution":{"observed_at":"2026-08-03T23:33:10.599346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-03T23:33:10.762432Z","title":"High fidelity neural audio compression.arXiv preprint arXiv:2210.13438, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:10.762432Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:c90f3b939b987d31ecf84b25110151b648ee6d4b0e5207b2fe1c03146d1f8e3e","observation_id":"cd58a492-5929-43bb-80ef-5fda749b9ca3","resolution":{"observed_at":"2026-08-03T23:33:10.762432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-03T23:33:10.927449Z","title":"Musiclm: Generating music from text.arXiv preprint arXiv:2301.11325, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:10.927449Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:f2fee60cdc13d60aa27417db15e13eeda5c5d37208ff4daa1f0089d7906198d0","observation_id":"f69cdc1b-5d2c-466c-913e-a034dbd5e48d","resolution":{"observed_at":"2026-08-03T23:33:10.927449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:11.079857Z","title":"Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:11.079857Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:d621ee3eb2e7238e56e8bfadb6e04e6b5c6748f54a5052da739242f46fa01025","observation_id":"8df9358b-bcd5-4364-86dd-a11398193ccb","resolution":{"observed_at":"2026-08-03T23:33:11.079857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:11.139125Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword- to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:11.139125Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:46d84724a7b0cea881a66f7a4dad27936e787f75c5039c91acc833df8b6bc6d0","observation_id":"2213bb4a-7dcf-493e-bbf7-0b6ed4041e9d","resolution":{"observed_at":"2026-08-03T23:33:11.139125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:11.190177Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:11.190177Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:a2ee127f4c7c71f93a10cede0f93a5ac80a036a1e66f81dfc81388a3e8e2c2a5","observation_id":"92941c68-c774-4120-944a-f89c9fe9f2ff","resolution":{"observed_at":"2026-08-03T23:33:11.190177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:11.270107Z","title":"Investigating the cortical tracking of speech and music with sung speech","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:11.270107Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:faed0dd223bd748c203e697e3a4ea408230d5a9013c6e3d21680e2f61fe9a2c8","observation_id":"6e8acff7-b0e9-4fa4-a818-522a0b054a83","resolution":{"observed_at":"2026-08-03T23:33:11.270107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:11.350321Z","title":"Neural signatures of musical and linguistic interactions during natural song listening.Hal preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:11.350321Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:0df319520c9a528c18182fd8dee0126f16816dd59354af483dc6ffa54d4b304e","observation_id":"751245a0-4414-42a3-a132-c4b02d144858","resolution":{"observed_at":"2026-08-03T23:33:11.350321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:11.433889Z","title":"Modelling the power spectra of natural images: statistics and information.Vision research, 36(17):2759–2770, 1996","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:11.433889Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:af619f8007ee5b2753c340a36054dac0cfa32b92a56d4b291b732060956de3f8","observation_id":"bc863112-f1fc-4552-95b6-62b2ab40ab86","resolution":{"observed_at":"2026-08-03T23:33:11.433889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:11.490266Z","title":"Nhss: A speech and singing parallel database.Speech Communication, 133:9–22, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:11.490266Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:675fb47e9ff92a9d350d502dbac5cc0970ac4264ac59d556a88b4060ff1fa550","observation_id":"8f5f0f8c-6222-443d-b2f7-9f3f8c76e83c","resolution":{"observed_at":"2026-08-03T23:33:11.490266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:33:11.565375Z","title":"The multivariate temporal response function (mtrf) toolbox: a matlab toolbox for relating neural signals to continuous stimuli.Frontiers in human neuroscience, 10:604, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:11.565375Z"},"links":{"citing_paper":"/paper/2511.05350"},"observation_digest":"sha256:606c702cec9d2261906fb21da8217c5526d25e3d23bda5f558ae9f67e78f8fac","observation_id":"21d9fc01-5226-4e3a-80d8-9d64a12de930","resolution":{"observed_at":"2026-08-03T23:33:11.565375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.05350","last_updated":"2026-07-07T12:35:40Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-03T23:33:05.680050Z","submitted_at":"2025-11-07T15:44:12Z","title":"Perceptually Aligning Representations of Music via Noise-Augmented Autoencoders"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2511.05350."}