{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d9180343ed77fe97c798011b03b2abeec50a257dd3823fe6a80e42a6a334c0e","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:44:17.796045Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02082/citation-record","integrity":"/paper/2506.02082/integrity","json":"/paper/2506.02082/citation-record.json","paper":"/paper/2506.02082"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T11:44:17.618021Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.618021Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:2f2de0134f69bc9ccc45239465a17d7c00585e7ee040351735e7598c380ef48d","observation_id":"02691a0c-79b2-460b-9721-f69bf7e95692","resolution":{"observed_at":"2026-08-07T11:44:17.618021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.625066Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.625066Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:14d04c7d192165d8f0b57b90f6bd1d3ef55bb6cf2623c6480ad47b32e22f19b8","observation_id":"c2e23147-c707-4322-a1db-88b238e4d96c","resolution":{"observed_at":"2026-08-07T11:44:17.625066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.631566Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.631566Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:fb82924bf7ab00f69af298c0212e0a6e05c3fc0e463664d722905f515059c490","observation_id":"19fe8f58-2378-4a75-80be-20807df4b347","resolution":{"observed_at":"2026-08-07T11:44:17.631566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.383538Z","title":"TERA: Self-supervised learning of transformer encoder representation for speech,","venue":null,"work_id":"f3ea09ee-8333-4d4d-b1c5-ffd75892438c","year":2021},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.638024Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:aa267e70953aa552d94525c17187a473e4a95e065f71681285a278a52224045b","observation_id":"0ea38d4e-bb61-43e4-974a-8cdc59922e95","resolution":{"observed_at":"2026-08-07T11:44:18.390260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09207","last_updated":"2016-11-28T15:51:25Z","snapshot_observed_at":"2026-07-06T05:20:23.576527Z","submitted_at":"2016-11-28T15:51:25Z","title":"AutoMOS: Learning a non-intrusive assessor of naturalness-of-speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09207","snapshot_observed_at":"2026-08-07T11:44:17.644998Z","title":"AUTOMOS: Learning a non-intrusive assessor of naturalness-of-speech,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.644998Z"},"links":{"cited_paper":"/paper/1611.09207","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:81ddb477dac67a6ffc2dc9668579a47b38fe2dc95ed22cd43758b44f8eef154c","observation_id":"a1983489-b854-4836-aa1b-fdb7682379f2","resolution":{"observed_at":"2026-08-07T11:44:17.644998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05344","last_updated":"2018-08-17T08:02:30Z","snapshot_observed_at":"2026-07-06T06:55:54.705302Z","submitted_at":"2018-08-16T04:26:41Z","title":"Quality-Net: An End-to-End Non-intrusive Speech Quality Assessment Model based on BLSTM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05344","snapshot_observed_at":"2026-08-07T11:44:17.651602Z","title":"Quality-net: An end- to-end non-intrusive speech quality assessment model based on blstm,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.651602Z"},"links":{"cited_paper":"/paper/1808.05344","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:76eb80cfcb88c503f1d6f848be6526a0c3f533fdb84cdd41d33553bd99adb766","observation_id":"888f7599-bd55-4125-84bc-a9f43f7a0964","resolution":{"observed_at":"2026-08-07T11:44:17.651602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.358604Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"8419333a-35c9-4304-8459-90c1084e3e67","year":2001},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.659966Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:698c135447a136a2a8b115fe69d953c448ecbe098b7f588eace81e414cc7480d","observation_id":"d57acf9b-c798-4cf0-9b6a-35142091227b","resolution":{"observed_at":"2026-08-07T11:44:18.365044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.339670Z","title":"Evaluation of speech representations for mos prediction,","venue":null,"work_id":"05c15ba7-396e-49c8-9a0f-a77a4860ba57","year":2023},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.667199Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:cbce14193b2d3989f6a38d0dc45aa1bf21e4b72c126bd5f6c949e98c50fb182f","observation_id":"b02c79b6-39e8-437a-9d8e-d2bff1aaa8b0","resolution":{"observed_at":"2026-08-07T11:44:18.346302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.317116Z","title":"Deep learning-based non-intrusive multi-objective speech assessment model with cross-domain features,","venue":null,"work_id":"9feb2175-2bb1-4381-b38b-fde71eaa7218","year":2022},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.672517Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:3ee70d54570d6997d8f0be8876198e4434108d334d481fa0d84ae4257c711211","observation_id":"9148ec3c-421a-43bd-8625-5cc092c63f54","resolution":{"observed_at":"2026-08-07T11:44:18.324451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08352","last_updated":"2021-07-14T07:32:49Z","snapshot_observed_at":"2026-08-08T00:23:46.265688Z","submitted_at":"2019-04-17T16:38:31Z","title":"MOSNet: Deep Learning based Objective Assessment for Voice Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08352","snapshot_observed_at":"2026-08-07T11:44:17.680497Z","title":"MOSNET: Deep learning based objective assessment for voice conversion,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.680497Z"},"links":{"cited_paper":"/paper/1904.08352","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:6464d4555dd8774427bed53da5ac22d4ae2a132d93df8eacac92c0d6b7d554eb","observation_id":"ed080602-d705-4148-958f-1e36bc095878","resolution":{"observed_at":"2026-08-07T11:44:17.680497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.294820Z","title":"MBNET: Mos prediction for synthesized speech with mean-bias network,","venue":null,"work_id":"79b965ca-d94f-44da-9c07-fa95f7efcbef","year":2021},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.688319Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:fc8d9a9fead6757fbc68f8314e66d44e9ba2a60ef6c5e591907518a8e4b91185","observation_id":"dab1aff8-dbb6-417d-aaa0-f98a13c6d6fc","resolution":{"observed_at":"2026-08-07T11:44:18.302247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.268492Z","title":"LDNET: Unified listener dependent modeling in mos prediction for synthetic speech,","venue":null,"work_id":"655a12ed-76fc-489d-a4b4-6a6d15145365","year":2022},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.695218Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:1bdf67ee503836e8ef683a8bd51f3c5d89075ae98f545b00e8ef9c8bcf7e5530","observation_id":"f1bc8676-32ed-4d9a-ab5e-8020b98bab0c","resolution":{"observed_at":"2026-08-07T11:44:18.274372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03219","last_updated":"2022-08-15T17:35:38Z","snapshot_observed_at":"2026-08-04T04:58:43.793083Z","submitted_at":"2022-04-07T05:04:10Z","title":"DDOS: A MOS Prediction Framework utilizing Domain Adaptive Pre-training and Distribution of Opinion Scores","version":3},"cited_work":{"arxiv_id":"2204.03219","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.03219","snapshot_observed_at":"2026-08-07T11:44:18.042388Z","title":"DDOS: A MOS Prediction Framework utilizing Domain Adaptive Pre-training and Distribution of Opinion Scores","venue":"eess.AS","work_id":"6fc7766c-9d1c-4bc8-af7d-627c6f60726e","year":2022},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.702839Z"},"links":{"cited_paper":"/paper/2204.03219","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:3c4e4aa958288663f6b9ace988ca81cdcb262422556e3c2e6866aa9b0b6daecc","observation_id":"367dae72-feec-411a-8996-461f21409134","resolution":{"observed_at":"2026-08-07T11:44:18.048488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.709392Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.709392Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:59404751a761f48c9c6ab97318fdcce9c17e1a5614d45a605816ac7a6dec1591","observation_id":"a7e43f76-0e26-4106-a15a-d284420f2959","resolution":{"observed_at":"2026-08-07T11:44:17.709392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-07T11:44:17.715160Z","title":"UTMOS: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.715160Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:c82499e8e1984d1406edecda0ffde9ca4583d66e0edb2e2692e222269ee9cc99","observation_id":"b8b67440-aadc-440a-adc2-e0d77a008300","resolution":{"observed_at":"2026-08-07T11:44:17.715160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.04855","last_updated":"2022-04-11T03:50:52Z","snapshot_observed_at":"2026-07-06T12:58:49.797086Z","submitted_at":"2022-04-11T03:50:52Z","title":"Fusion of Self-supervised Learned Models for MOS Prediction","version":1},"cited_work":{"arxiv_id":"2204.04855","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.04855","snapshot_observed_at":"2026-08-07T11:44:17.993784Z","title":"Fusion of Self-supervised Learned Models for MOS Prediction","venue":"cs.SD","work_id":"44fc7f31-c239-4a1c-a65b-2cb602b47ae1","year":2022},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.720703Z"},"links":{"cited_paper":"/paper/2204.04855","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:15536947b3a04ea71a5144cd6b4dc219602f7ebd745715ba8331397b9c00fa6a","observation_id":"b5d7a4de-583e-489f-a575-3c0c73ee414a","resolution":{"observed_at":"2026-08-07T11:44:18.004321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10493","last_updated":"2023-06-18T07:38:17Z","snapshot_observed_at":"2026-08-07T06:13:53.790129Z","submitted_at":"2023-06-18T07:38:17Z","title":"MOSPC: MOS Prediction Based on Pairwise Comparison","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10493","snapshot_observed_at":"2026-08-07T11:44:17.727766Z","title":"MOSPC: Mos predic- tion based on pairwise comparison,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.727766Z"},"links":{"cited_paper":"/paper/2306.10493","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:a89314df48b48d26834dcc01c0dcfd5d6cdcdb2217127f479735491b71cbf908","observation_id":"41d06764-3c28-4b9a-9229-41f4a80baf47","resolution":{"observed_at":"2026-08-07T11:44:17.727766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.12285","last_updated":"2022-06-24T13:34:53Z","snapshot_observed_at":"2026-08-03T04:28:29.891043Z","submitted_at":"2022-06-24T13:34:53Z","title":"Speech Quality Assessment through MOS using Non-Matching References","version":1},"cited_work":{"arxiv_id":"2206.12285","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.12285","snapshot_observed_at":"2026-08-07T11:44:17.939648Z","title":"Speech Quality Assessment through MOS using Non-Matching References","venue":"eess.AS","work_id":"4ffe930d-99a8-4163-ab29-e292b8d93c88","year":2022},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.734793Z"},"links":{"cited_paper":"/paper/2206.12285","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:3d5dbf8595f0f0b505fa9b00f37a50d479c6a2088f24d05d1d5e6ac189c03b9e","observation_id":"220b25bd-0434-4023-9b39-cf319156dd00","resolution":{"observed_at":"2026-08-07T11:44:17.946189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:17.741382Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.741382Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:c817917d3c47ae84a64a0078ec1f2eb735ea9f8395a784f75c8a1a84a1537030","observation_id":"2dfbb2a6-1e08-49e7-a198-02301099feb2","resolution":{"observed_at":"2026-08-07T11:44:17.741382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.216345Z","title":"Perceptual objective listening quality assess- ment (POLQA), the third generation itu-t standard for end-to-end speech quality measurement part i—temporal alignment,","venue":null,"work_id":"efa26c61-e0bc-4c9b-ae0b-1388fcdb4a81","year":2013},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.748440Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:39a1be7eb920e4db05d590082d738b005d962404b5e2025294731c590e5285fb","observation_id":"e1f91c3c-ccd9-419b-9590-0feaf4e98c56","resolution":{"observed_at":"2026-08-07T11:44:18.223846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.193023Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"d7a4b015-ca64-4702-a5b7-053d0429ae3b","year":2010},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.755047Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:e7ad779e0ec3d6df3d148f2decf2ed219658876e5cb35088ffce1280a521991f","observation_id":"52aae80b-685e-455a-9b2f-bb90c42a645f","resolution":{"observed_at":"2026-08-07T11:44:18.199291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11389","last_updated":"2022-07-04T01:13:01Z","snapshot_observed_at":"2026-08-08T00:23:49.618708Z","submitted_at":"2022-03-21T23:32:08Z","title":"The VoiceMOS Challenge 2022","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11389","snapshot_observed_at":"2026-08-07T11:44:17.760799Z","title":"The voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.760799Z"},"links":{"cited_paper":"/paper/2203.11389","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:e37404dc781d44faeb34b7d9699190b8ef55c0df1fab852f12ee20c3d0365809","observation_id":"b03e58a3-6fd4-4615-98b8-157532293267","resolution":{"observed_at":"2026-08-07T11:44:17.760799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04262","last_updated":"2018-04-12T00:14:10Z","snapshot_observed_at":"2026-07-06T06:33:01.922458Z","submitted_at":"2018-04-12T00:14:10Z","title":"The Voice Conversion Challenge 2018: Promoting Development of Parallel and Nonparallel Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04262","snapshot_observed_at":"2026-08-07T11:44:17.767102Z","title":"The voice conversion challenge 2018: Promoting development of parallel and nonparallel methods,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.767102Z"},"links":{"cited_paper":"/paper/1804.04262","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:3e3e02774d11238d34d56605e1386b5c7d9415c83de53d19a57faf9c016c41a5","observation_id":"69057cac-d56f-43b8-88c7-20aa16930c5c","resolution":{"observed_at":"2026-08-07T11:44:17.767102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03040","last_updated":"2022-08-24T14:24:57Z","snapshot_observed_at":"2026-07-06T12:57:36.510755Z","submitted_at":"2022-04-06T18:45:20Z","title":"SOMOS: The Samsung Open MOS Dataset for the Evaluation of Neural Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03040","snapshot_observed_at":"2026-08-07T11:44:17.773360Z","title":"SOMOS: The samsung open mos dataset for the evaluation of neural text-to-speech synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.773360Z"},"links":{"cited_paper":"/paper/2204.03040","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:1082b9992794bc85b433d5019bdadd9b599d3d15c4eb52abb1218022fe3a136b","observation_id":"85f38dec-661a-4107-b374-415b0001405f","resolution":{"observed_at":"2026-08-07T11:44:17.773360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02585","last_updated":"2022-07-01T01:54:32Z","snapshot_observed_at":"2026-07-06T12:05:15.287457Z","submitted_at":"2021-11-04T02:01:27Z","title":"InQSS: a speech intelligibility and quality assessment model using a multi-task learning network","version":3},"cited_work":{"arxiv_id":"2111.02585","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02585","snapshot_observed_at":"2026-08-07T11:44:17.848030Z","title":"InQSS: a speech intelligibility and quality assessment model using a multi-task learning network","venue":"cs.SD","work_id":"a4d5239a-1360-4d2c-a138-2e58cd71b69e","year":2021},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.783207Z"},"links":{"cited_paper":"/paper/2111.02585","citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:bda7fa577cffceea4d4d8141662344f1da34a2a26d8d070ba2c8ef2d4fc0b97f","observation_id":"a6b79536-61c2-4870-96f6-7dc5100f0201","resolution":{"observed_at":"2026-08-07T11:44:17.855886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.171653Z","title":"LE-SSL-MOS: Self-supervised learning mos prediction with listener enhancement,","venue":null,"work_id":"f68933ad-1954-41dc-87b2-e5cf48e85cc4","year":2023},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.790700Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:b5d281722dc90b0788db743853f5eb5853deec807cac650e2199c9321a1946db","observation_id":"b16f79fd-15d8-4d3e-8122-3f08a56ba9a7","resolution":{"observed_at":"2026-08-07T11:44:18.180511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:18.152654Z","title":"X-vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":"64d44a90-8967-4c40-b6d9-150eaa5fedf2","year":2018},"citing_paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:17.796045Z"},"links":{"citing_paper":"/paper/2506.02082"},"observation_digest":"sha256:4d8abb6d3fb08d4045f6476fca9f97d692d40e7dbd0dc040caaef02be2436218","observation_id":"065f0d59-b72a-410d-8802-f5139d7fc6ee","resolution":{"observed_at":"2026-08-07T11:44:18.158851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02082","last_updated":"2025-06-02T10:45:40Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T00:25:40.747351Z","submitted_at":"2025-06-02T10:45:40Z","title":"SALF-MOS: Speaker Agnostic Latent Features Downsampled for MOS Prediction"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":4,"verified_fuzzy":10},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2506.02082."}