{"as_of":"2026-08-06T16:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b8845248c38567c92b34bbe9ac91340c2de01bf198429fb0587c520dd41ce46","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:53:18.015252Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:53:15.843405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.12222","snapshot_observed_at":"2026-08-03T09:53:15.843405Z","title":"Our frame- work outperforms two strong baselines across all four stan- dard metrics","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.843405Z"},"links":{"cited_paper":"/paper/2601.12222","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:503633afbc852b2f5c475a6b9b1196489ef7d906adb28f7e9bd1f0a059d36527","observation_id":"28e5def6-3a69-4942-955f-01106ae65b38","resolution":{"observed_at":"2026-08-03T09:53:15.843405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.12222/citation-record","integrity":"/paper/2601.12222/integrity","json":"/paper/2601.12222/citation-record.json","paper":"/paper/2601.12222"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.766397Z","title":"This highlights the urgency for automated song aesthetics evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.766397Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:5efbf45126de99c76a63f3b1c2d4fb96c554b5f1ff5107772ea844e47b6953c0","observation_id":"b7405806-77a9-40c0-9151-de434ba94455","resolution":{"observed_at":"2026-08-03T09:53:15.766397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.898451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.898451Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:d0ca9355be170e7f580bc46a27f478d48cb1751df6d534c04c28e390869c53c9","observation_id":"6b9eee91-095f-4f41-a56d-3f092280d4a2","resolution":{"observed_at":"2026-08-03T09:53:15.898451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.12222","snapshot_observed_at":"2026-08-03T09:53:15.843405Z","title":"Our frame- work outperforms two strong baselines across all four stan- dard metrics","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.843405Z"},"links":{"cited_paper":"/paper/2601.12222","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:503633afbc852b2f5c475a6b9b1196489ef7d906adb28f7e9bd1f0a059d36527","observation_id":"28e5def6-3a69-4942-955f-01106ae65b38","resolution":{"observed_at":"2026-08-03T09:53:15.843405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.987946Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.987946Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:5d40598ede9858b1b62b701757f924f787520badfaf7d94fad1252054c38ecf0","observation_id":"6cbd7d0f-c4a0-4891-99ff-df24604e2729","resolution":{"observed_at":"2026-08-03T09:53:15.987946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.933102Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.933102Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:000f03cf7337e440ad6d517435663162392aad9346984c94c9eed2c3842082f1","observation_id":"702cce5f-3306-4178-9229-f9048c362e89","resolution":{"observed_at":"2026-08-03T09:53:15.933102Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.591925Z","title":"Musiceval: A generative music dataset with expert rat- ings for automatic text-to-music evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.591925Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:7ec29343f0408a45497adce8f7a81702c76a497c4ff0cbd188b5bc28121a2c39","observation_id":"ea79b601-4054-4930-9b40-565d6bca1f48","resolution":{"observed_at":"2026-08-03T09:53:16.591925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.089451Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.089451Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:4fc0313bde85006b1b5732e35edaa9ff4ba755601c450d9fb9c9351487cb7d33","observation_id":"b6bf4394-ebdf-4294-8c0e-85c4502f22c5","resolution":{"observed_at":"2026-08-03T09:53:16.089451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:15.806089Z","title":"However, these studies mostly do not target full-length song aesthetics evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:15.806089Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:2303ab36a777cebf8a04cbc308615f9ed02acd1769bca861b817e929d965922e","observation_id":"37942e44-ed09-4f36-9d98-dac668ad1b02","resolution":{"observed_at":"2026-08-03T09:53:15.806089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.169145Z","title":"Ldnet: Unified listener dependent mod- eling in mos prediction for synthetic speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.169145Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:57a8585baa1efaff8b86db6136890855aa9ce39035f04b5a95628994d9bb5cd5","observation_id":"17f71b31-c5a4-4901-a927-9e71fd295ea9","resolution":{"observed_at":"2026-08-03T09:53:16.169145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.236180Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.236180Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:48a56f50ba4f2d732feab9e47815c6c2bdfd3a747cfe6271630f1b34bf492852","observation_id":"d4cfbd10-8a22-405e-9cf2-3efbae58ffa7","resolution":{"observed_at":"2026-08-03T09:53:16.236180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.299735Z","title":"Pitch-and-spectrum-aware singing quality assessment with bias correction and model fu- sion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.299735Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:b46730d743a9ddb5e2547a59dd6e6d8e3fced64590a9c4a6a292418c2f2cffa0","observation_id":"2b1d64be-1e71-42cd-8b71-bbffef20880d","resolution":{"observed_at":"2026-08-03T09:53:16.299735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.429516Z","title":"End- to-end automatic singing skill evaluation using cross- attention and data augmentation for solo singing and singing with accompaniment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.429516Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:784d51578c967f485af253344c9472bf771ee4a3ce722e1d36727e69bc0215cc","observation_id":"a10ba54a-1c1e-49ac-aae4-b5efe1f27d56","resolution":{"observed_at":"2026-08-03T09:53:16.429516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-05T12:41:24.295900Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01336","snapshot_observed_at":"2026-08-03T09:53:16.690620Z","title":"The audiomos challenge 2025,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.690620Z"},"links":{"cited_paper":"/paper/2509.01336","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:eed2aa1967cfff171c0c3a042a3a46b9a65d77d3c2e2cff27cf294c24597ab92","observation_id":"08935185-338f-4cbd-a06d-1242a073ac96","resolution":{"observed_at":"2026-08-03T09:53:16.690620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.750745Z","title":"Mm- mos: Multi-domain multi-axis audio quality assess- ment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.750745Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:c541c2cfa6eab0456417943d64073943278039ce66fb0646e909d9e4e00ebe42","observation_id":"3a901e94-5d4c-499a-b71d-94067222f9fe","resolution":{"observed_at":"2026-08-03T09:53:16.750745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-03T09:53:16.809406Z","title":"Meta au- diobox aesthetics: Unified automatic quality assess- ment for speech, music, and sound,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.809406Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:20608f4bb2edf5ed04bf4b9b6898460fdf3920a44b35c35c74d992a0d4f0572b","observation_id":"c06d3fcd-d518-4eb5-bc67-a7ce980af0e0","resolution":{"observed_at":"2026-08-03T09:53:16.809406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10793","last_updated":"2025-05-16T02:06:25Z","snapshot_observed_at":"2026-08-06T08:13:52.709687Z","submitted_at":"2025-05-16T02:06:25Z","title":"SongEval: A Benchmark Dataset for Song Aesthetics Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10793","snapshot_observed_at":"2026-08-03T09:53:16.885407Z","title":"Songeval: A benchmark dataset for song aesthetics evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.885407Z"},"links":{"cited_paper":"/paper/2505.10793","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:7ef5cd0755e24ac07e1ee9bc9b6bc3121f3b2917fc8808bcc3d3cb73cb94f0f9","observation_id":"99d3aa96-020d-4d69-b566-d6b70846536d","resolution":{"observed_at":"2026-08-03T09:53:16.885407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:16.977985Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.977985Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:03c19eac526b463a54d8f7f4d370305d92ab85f7004375bea72f898b071ff385","observation_id":"4653ee49-b08f-45d8-9268-1313cfc42ab7","resolution":{"observed_at":"2026-08-03T09:53:16.977985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01108","last_updated":"2025-01-03T08:35:34Z","snapshot_observed_at":"2026-08-02T14:58:36.177043Z","submitted_at":"2025-01-02T07:08:29Z","title":"MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01108","snapshot_observed_at":"2026-08-03T09:53:17.035715Z","title":"Muq: Self-supervised music representation learning with mel residual vector quantization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.035715Z"},"links":{"cited_paper":"/paper/2501.01108","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:3b7d39a17ca495c58ca1c54269de580f2cd55172632e7ec3efb21b57bb632927","observation_id":"17484b94-1b38-4d80-bc7d-a3ef2264da95","resolution":{"observed_at":"2026-08-03T09:53:17.035715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.070696Z","title":"Cbam: Convolutional block attention module,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.070696Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:9b02c7bfac46ea404f2b157d314e3024ba3311c354437ec2fb1eb6aa6deb56bb","observation_id":"93dcecb5-14d0-417f-b9e3-b4715020a88e","resolution":{"observed_at":"2026-08-03T09:53:17.070696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.140292Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.140292Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:9d5e70ffbb099a8adb1bb51d00717956dcf4e2d08c0fceb9f4ab04e4cbfe4dae","observation_id":"78ea390a-8489-46ea-b467-1628e38268ce","resolution":{"observed_at":"2026-08-03T09:53:17.140292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.238396Z","title":"Perceiving longer sequences with bi-directional cross- attention transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.238396Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:af89b8b9ce5f65dcab59b754da37a364d539183db9e3a8e642b0d1f932def62c","observation_id":"6790b825-1cfc-4ff6-af6a-61e8e1407f45","resolution":{"observed_at":"2026-08-03T09:53:17.238396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.401352Z","title":"A hierarchical de- pression detection model based on vocal and emotional cues,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.401352Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:4b77aac6747175c749b3459e323eae1e9ab90719390e6dd35ecd318a80c65107","observation_id":"6f43bb73-d39d-4a57-8256-ef87a8adb9e0","resolution":{"observed_at":"2026-08-03T09:53:17.401352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.519523Z","title":"Generalization ability of mos predic- tion networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.519523Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:064427f9279d2c75574eb886719a1c4184459c60682fcacae56860e4b002c663","observation_id":"c466f080-c757-400d-9a82-d98609a7bc1d","resolution":{"observed_at":"2026-08-03T09:53:17.519523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:17.705420Z","title":"The voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.705420Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:357ad879ee42c5cefea4a4aae88437eb9f40778538f7eab60055198ceb4df669","observation_id":"3f5fd9d6-7dab-4516-a51a-97895b31a49a","resolution":{"observed_at":"2026-08-03T09:53:17.705420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12203","last_updated":"2021-11-24T00:10:35Z","snapshot_observed_at":"2026-07-06T12:11:34.830889Z","submitted_at":"2021-11-24T00:10:35Z","title":"KUIELab-MDX-Net: A Two-Stream Neural Network for Music Demixing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12203","snapshot_observed_at":"2026-08-03T09:53:17.817175Z","title":"Kuielab-mdx-net: A two-stream neural network for music demixing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:17.817175Z"},"links":{"cited_paper":"/paper/2111.12203","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:7970f91d77d70f0ca8a31dabc30cf392b645cdb839111bd489a7cc0cb8120ea8","observation_id":"c7fbf6b8-7ecb-4764-9616-b8ef4d518f91","resolution":{"observed_at":"2026-08-03T09:53:17.817175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:53:18.015252Z","title":"The voicemos challenge 2024: Beyond speech quality prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:18.015252Z"},"links":{"citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:c24f0ec23e48d2c7dd1e60fae7837f62f1e7b6bfa7a01a3177f137a6494d761e","observation_id":"e783e582-dc98-4ab4-8397-0f925ded92d6","resolution":{"observed_at":"2026-08-03T09:53:18.015252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-03T09:53:15.488902Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2601.12222."}