{"as_of":"2026-08-08T19:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29e734b50c387889dbff4f0e086ac7ea9f42157101af25a5adfc2682d83ba4a0","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:28:03.066429Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:27:58.440889Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:59:56.411210Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15061","snapshot_observed_at":"2026-08-07T15:27:58.440889Z","title":"<anonymized>/sheet:v0.1.0","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:58.440889Z"},"links":{"cited_paper":"/paper/2505.15061","citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:f4933aad85940086c30c69d3430f3b12d9d44bc2f914586f62051899b9ff6a67","observation_id":"c51a7411-f08c-4fc3-a1fc-95f2ca59c90d","resolution":{"observed_at":"2026-08-07T15:27:58.440889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"cited_work":{"arxiv_id":"2505.15061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15061","snapshot_observed_at":"2026-08-07T00:59:56.411210Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","venue":"cs.SD","work_id":"7c98b9b2-c521-450b-8def-4d2fc50711bd","year":2025},"citing_paper":{"arxiv_id":"2506.12260","last_updated":"2025-08-22T06:43:05Z","snapshot_observed_at":"2026-08-07T00:52:24.011528Z","submitted_at":"2025-06-13T22:22:19Z","title":"Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:55.643986Z"},"links":{"cited_paper":"/paper/2505.15061","citing_paper":"/paper/2506.12260"},"observation_digest":"sha256:e7c8fbb3dedd4755bd704e98f5901fb4858d1e9bc891084b3d78411868b8cfb8","observation_id":"7b40b310-2311-414f-955d-0e1c5e80c18d","resolution":{"observed_at":"2026-08-07T00:59:56.456405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15061/citation-record","integrity":"/paper/2505.15061/integrity","json":"/paper/2505.15061/citation-record.json","paper":"/paper/2505.15061"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15061","snapshot_observed_at":"2026-08-07T15:27:58.440889Z","title":"<anonymized>/sheet:v0.1.0","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:58.440889Z"},"links":{"cited_paper":"/paper/2505.15061","citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:f4933aad85940086c30c69d3430f3b12d9d44bc2f914586f62051899b9ff6a67","observation_id":"c51a7411-f08c-4fc3-a1fc-95f2ca59c90d","resolution":{"observed_at":"2026-08-07T15:27:58.440889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:07.032690Z","title":"Speech Quality Estimation: Models and Trends,","venue":null,"work_id":"2643cf4c-bb22-48a5-811e-94550c4abe35","year":2011},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:59.485160Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:987de05ac6fd66a7c8ac37d5055b56b7108dc8d9f219f90a526c3d472db64c17","observation_id":"17b03289-f42a-4ff1-9120-16048fd7ddba","resolution":{"observed_at":"2026-08-07T15:28:07.115842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:08.028877Z","title":null,"venue":null,"work_id":"a2854d5d-4ba4-486c-be4f-2e3571b9d428","year":null},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:58.531292Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:d4d18b69daaed33c49baca898136df700f4c6a7a7e1caf2c5deea8114c7b8a86","observation_id":"6cb42b73-4b7c-4e0d-b8d1-ca4a168bef27","resolution":{"observed_at":"2026-08-07T15:28:08.125815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:07.595399Z","title":null,"venue":null,"work_id":"150d6d59-c7bd-4af8-a34a-be208c821899","year":null},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:59.054106Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:d30082c2c762ccc27e04d2119689fd01ee05325e37115cb35083b37d24b45cec","observation_id":"acdeb8db-a514-4603-be5a-a3073b640b40","resolution":{"observed_at":"2026-08-07T15:28:07.650385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:07.379276Z","title":null,"venue":null,"work_id":"6e3f6af1-e23d-4e4b-a1d3-a8a4af9e7d91","year":null},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:59.224815Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:1b74eb24701ba404cebaf23c669848c9fee1c00d63eb7ab54160952ebf17e526","observation_id":"02d4cf45-0602-4757-924f-479bd72ce4c7","resolution":{"observed_at":"2026-08-07T15:28:07.455618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:06.619548Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"d4b0db08-bdc2-4f63-9453-2bf30be8f61d","year":2001},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:00.021869Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:3aa4c01c11c96a79737c861afed506f74c0c88bd93d2341ecfd32559679dd409","observation_id":"6343ec3b-5f95-4d1f-8882-45224c0b29f6","resolution":{"observed_at":"2026-08-07T15:28:06.671159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:07.252412Z","title":"Speech quality assessment,","venue":null,"work_id":"88d4667a-a5e4-4a73-83e6-6a482c83b552","year":2011},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:59.348457Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:c9e8dd8427c705492a7dc3d9b57885f08a03c1cb3c62d3b3f293385d830feb4a","observation_id":"6dc804ba-5b49-4974-bdae-b4568eb53419","resolution":{"observed_at":"2026-08-07T15:28:07.310950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:06.503560Z","title":"MOSNet: Deep Learning-Based Objective Assessment for Voice Conversion,","venue":null,"work_id":"53b0ce3b-77a2-4046-b227-46c61258999f","year":2019},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:00.299044Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:f6a2de35f5bbf5966f5bcba82afde2a6a73688ff61d60aef79dd1cb4943af28f","observation_id":"81616ce7-c9a7-4040-8ebb-725042a8ae56","resolution":{"observed_at":"2026-08-07T15:28:06.572907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:06.833243Z","title":"A review on subjective and objective evaluation of synthetic speech,","venue":null,"work_id":"488b2aaf-a6df-4d03-a7fc-2449a5318965","year":2024},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:59.598535Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:9bbda6698524e7af4a5af6092f939c5d304c895c2c3622fb46bb41284636fc36","observation_id":"68135304-236a-4e45-b0f4-f58a04201fbe","resolution":{"observed_at":"2026-08-07T15:28:06.931041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:06.771253Z","title":"An Al- gorithm for Intelligibility Prediction of TimeFrequency Weighted Noisy Speech,","venue":null,"work_id":"7ed44f08-c25d-404e-8c4b-b50413b83461","year":2011},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:59.715325Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:7e54da5d718addf255570bf119c2e7131cd1ec83eeb8c7c189bae3f4e5823312","observation_id":"687b92b2-576d-49de-8a40-44c29a674ede","resolution":{"observed_at":"2026-08-07T15:28:06.792909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:59.834694Z","title":"Mel-cepstral distance measure for objective speech quality assessment,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:59.834694Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:d2da427011099728025be36300df0df34b38f1cbd09247ed6d77e83f685805e6","observation_id":"de63a51d-0cb1-4d18-93a7-9c8d608a27fc","resolution":{"observed_at":"2026-08-07T15:27:59.834694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:06.100609Z","title":"The Voicemos Challenge 2024: Beyond Speech Quality Prediction,","venue":null,"work_id":"8f6d0d32-3c67-44c8-97e6-bcd82a2477e2","year":2024},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:00.865900Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:377ff46bad42824a428f1e2a4b900b0430f0eb0da966aa28ad96a71e57d0a2c5","observation_id":"fdf9fadf-3cfe-4cf3-aabe-06025d193970","resolution":{"observed_at":"2026-08-07T15:28:06.136858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09207","last_updated":"2016-11-28T15:51:25Z","snapshot_observed_at":"2026-07-06T05:20:23.576527Z","submitted_at":"2016-11-28T15:51:25Z","title":"AutoMOS: Learning a non-intrusive assessor of naturalness-of-speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09207","snapshot_observed_at":"2026-08-07T15:28:00.137013Z","title":"AutoMOS: Learning a non- intrusive assessor of naturalness-of-speech,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:00.137013Z"},"links":{"cited_paper":"/paper/1611.09207","citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:4f6c3e405a450bc4b312f1d4f47f38ffcc637433983a56c1a121587a20bf18d3","observation_id":"3d832d82-6e22-446a-a8ad-6fc86894596d","resolution":{"observed_at":"2026-08-07T15:28:00.137013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:05.958498Z","title":"Torchaudio-squim: Reference-less speech quality and intelligibility measures in torchaudio,","venue":null,"work_id":"d2421014-3796-452f-a421-fc5b924e3381","year":2023},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:00.998429Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:80d2969e377c3ff7012e0ea23e78801e2e265028e8627d536f9ccb9cfa835744","observation_id":"112ea42e-d165-4702-93a4-b64fc554ff7d","resolution":{"observed_at":"2026-08-07T15:28:05.985689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:06.370010Z","title":"DNSMOS: A Non- Intrusive Perceptual Objective Speech Quality Metric to Evaluate Noise Suppressors,","venue":null,"work_id":"89e058aa-166f-48c4-817b-ff3541074e4e","year":2021},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:00.477433Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:4af33dc2724de90132be48a342649fef4f22cab6cacdf9a1afdcf5f3f2cc6da8","observation_id":"8e877be0-1bf8-40f4-93e3-24bc5b71b792","resolution":{"observed_at":"2026-08-07T15:28:06.428593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:06.241970Z","title":"The VoiceMOS Challenge 2022,","venue":null,"work_id":"08827fa4-8d37-43c9-88d4-0b01e8c2e943","year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:00.619961Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:7b0e27b44f251df9b4020c217e1f344aa8e86011a99da47d4a11fc23a24e2101","observation_id":"2d9b6c6b-c28b-4b88-aa88-7e6ee7546c46","resolution":{"observed_at":"2026-08-07T15:28:06.306170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:06.176006Z","title":"The Voicemos Challenge 2023: Zero-Shot Subjective Speech Quality Prediction for Multiple Domains,","venue":null,"work_id":"eabbbfe6-5c54-482d-ab99-e078806b4366","year":2023},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:00.754218Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:4a2488593430595030d11deff47a084b8e676e2413cab0c679cdc47c7e92fac5","observation_id":"2482ec1a-57d7-4a76-97db-7b8ccef0660a","resolution":{"observed_at":"2026-08-07T15:28:06.208074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:05.756453Z","title":"Generaliza- tion ability of MOS prediction networks,","venue":null,"work_id":"832dffe3-3c7c-44ed-bc83-2c61cc0457c6","year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:01.379773Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:b70d1c2a8a85c66088e014369dd947aaf443fe54e732d92e62ff4dd4f762dc0f","observation_id":"6e572b51-e5f8-42c1-a471-a64f910c57d0","resolution":{"observed_at":"2026-08-07T15:28:05.792093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:06.022004Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022,","venue":null,"work_id":"23d780a6-3bae-4c47-832a-4c6e98780243","year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:00.932454Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:82f7ae701e81376defc2da2d73602393fe76cf7fdb8d4b2761b9e3d713de6693","observation_id":"5c1ce8ff-68a5-48db-97cb-bbf5d3200416","resolution":{"observed_at":"2026-08-07T15:28:06.056204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:01.602221Z","title":"How do voices from past speech synthesis challenges compare today?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:01.602221Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:d6b49ae51a2ce3316e74fae7d79ba9e55c080e0ec7e7ec4b79507db14487a2f7","observation_id":"0e4c87d8-7628-4902-9837-75848e9a1bba","resolution":{"observed_at":"2026-08-07T15:28:01.602221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:05.888226Z","title":"SpeechBERTScore: Reference-Aware Automatic Evaluation of Speech Generation Leveraging NLP Evaluation Metrics,","venue":null,"work_id":"8fdd152a-0efc-49ca-8131-bcefc9f1e1c3","year":2024},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:01.102877Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:e44d0e892cc6e21fb626e24dee6c9cf2c865e417e3002e25d6c48a1c9a196436","observation_id":"d2e3d3b2-f745-46f9-929f-7e5ec3b75e7b","resolution":{"observed_at":"2026-08-07T15:28:05.916549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17667","last_updated":"2025-03-27T03:50:10Z","snapshot_observed_at":"2026-08-04T18:12:22.604177Z","submitted_at":"2024-12-23T15:53:21Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17667","snapshot_observed_at":"2026-08-07T15:28:01.173993Z","title":"Versa: A versatile evaluation toolkit for speech, audio, and music,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:01.173993Z"},"links":{"cited_paper":"/paper/2412.17667","citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:07bf2b410657c8f16159d5bc4cd4b23d7cd54e30ac13c09c3355f5fe350d52a1","observation_id":"2ca48c2f-7018-4db2-8bf8-a2f6be8817d2","resolution":{"observed_at":"2026-08-07T15:28:01.173993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:05.823356Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets,","venue":null,"work_id":"fbab3610-3ef2-4017-878d-234ebec48afb","year":2021},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:01.260758Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:5b7c18deac7ee74165db6545cda6fff11c9ca31cbf48257ea8ac3998b6b64e43","observation_id":"09396629-52f3-4690-b895-9a39664efe2e","resolution":{"observed_at":"2026-08-07T15:28:05.862548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:02.135446Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.135446Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:73dff91fe9ccfbb801281c82b1b48feb0560fed10d28c9976e8ebc35061300d4","observation_id":"6453a74d-c0b7-4f19-b1d8-8f0fac00084d","resolution":{"observed_at":"2026-08-07T15:28:02.135446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:05.690407Z","title":"RAMP: Retrieval- Augmented MOS Prediction via Confidence-based Dynamic Weighting,","venue":null,"work_id":"bdb76a22-af9e-482b-aaf3-2ec39b359789","year":2023},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:01.445768Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:e018f9022900f80c1e84a102bebd000bb66f5f75e8caaced32aceb9fa4a63fea","observation_id":"c2b7b22f-4ad8-4c73-91b0-4c51f9f0dc13","resolution":{"observed_at":"2026-08-07T15:28:05.714739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:04.979711Z","title":"The Singing Voice Conversion Challenge 2023,","venue":null,"work_id":"3172f1bd-426d-4e59-85d1-3bda54fb32bd","year":2023},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.269699Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:1a312330dd7bebd1724ea87adb702667a165f8d3259f65bac4a3212d5b469fc7","observation_id":"936f9241-75e6-43bb-8913-339eb3930deb","resolution":{"observed_at":"2026-08-07T15:28:05.059446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:05.588065Z","title":"The Kaldi Speech Recognition Toolkit,","venue":null,"work_id":"acab3ced-7726-480b-8a42-5237f4004193","year":2011},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:01.743471Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:dbde898c57be23a76fd79ef69b6fad459bb0a7ee772a54e928c31820ea846ac0","observation_id":"6294b4b8-8c7e-4460-af43-589f6412482f","resolution":{"observed_at":"2026-08-07T15:28:05.645976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:05.477228Z","title":"ESPnet: End-to-End Speech Processing Toolkit,","venue":null,"work_id":"e0640ec1-645b-4d85-a4a5-28f5d723aa5c","year":2018},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:01.880783Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:7dcdc05900485905b831a8ea5690b9609f46976b168b6db30af89bd51f6aaa2c","observation_id":"86aaaa1a-b7c7-4d64-82a6-0341515bb59b","resolution":{"observed_at":"2026-08-07T15:28:05.535217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:05.353064Z","title":"An End- To-End Non-Intrusive Model for Subjective and Objective Real- World Speech Assessment Using a Multi-Task Framework,","venue":null,"work_id":"51f95a34-9c3a-4328-8d17-ddc5035966df","year":2021},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.016260Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:d6f8ec982379090b657778f340979ea744a8943d62aed9ea5dadbd6e83ce3897","observation_id":"07f8f61e-1b87-42df-9ecf-7ae14f9ea84e","resolution":{"observed_at":"2026-08-07T15:28:05.422256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:04.110426Z","title":"Espnet-TTS: Unified, Reproducible, and Integratable Open Source End-to-End Text-to- Speech Toolkit,","venue":null,"work_id":"d359b081-09b6-4b8a-b44e-f7627eaf0be3","year":2020},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.452285Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:2f55f93d8deb2c9ab76574e732eacf8b2c3e544701ab8f2e2723f7344cbb1614","observation_id":"0d1a0ec6-69e4-4859-98c9-6c1d8c39dd40","resolution":{"observed_at":"2026-08-07T15:28:04.228324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:05.146727Z","title":"Utilizing Self-Supervised Representations for MOS Prediction,","venue":null,"work_id":"090fefab-167c-41a3-89ab-54dc20746fec","year":2021},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.239871Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:2cd265affab1bb7621f66ad75a8443351556c04bd07671fc7198a10618cdf450","observation_id":"fd44c759-bdfc-4bd8-b71d-c3ecc88d89b8","resolution":{"observed_at":"2026-08-07T15:28:05.259311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:07.764527Z","title":"On the NISQA dataset, on average, the WavLM large model [33] and the XLS-R 1b model [34] achieved the best and second best scores on the Sys MSE and Sys SRCC metrics, respectively","venue":null,"work_id":"800ae816-8cc7-4a07-8c2f-672eccfbba45","year":2024},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:58.911703Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:48d25761b6714abc2b8455a5930616fa396ab03d4a782af938f66b1bc0e02f93","observation_id":"23d6e7d9-910d-4aeb-bd38-8534d5b49be5","resolution":{"observed_at":"2026-08-07T15:28:07.871031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:04.767900Z","title":"MB- NET: MOS Prediction for Synthesized Speech with Mean-Bias Network,","venue":null,"work_id":"0e5c026d-f0c5-49d5-ad46-f0d78cd575fb","year":2021},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.282769Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:83e3cdb00c6cf177d88d14e3901181f2186e1aafd9398fe20a2eb1368be1a5b5","observation_id":"d9a2b204-f6f0-48eb-92f0-453313c43342","resolution":{"observed_at":"2026-08-07T15:28:04.888066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:04.567859Z","title":"LDNet: uni- fied listener dependent modeling in MOS prediction for synthetic speech,","venue":null,"work_id":"baff00bd-f57e-44a7-8e0e-0e9ee07ff70a","year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.320774Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:1a0aaafbb991e4159eb32ced1b16b75821423319ff62d5ac288ee76573284459","observation_id":"ccae44fd-d877-47cd-ac64-edd7305536fd","resolution":{"observed_at":"2026-08-07T15:28:04.675473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:04.347213Z","title":"Alignnet: Learning dataset score align- ment functions to enable better training of speech quality estima- tors,","venue":null,"work_id":"36f8db97-8ce1-4e47-bea8-bd7dfb17e280","year":2024},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.393441Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:fdc0ab8cef2a1c63c0df9096303449be7e184305f87decbd0aea6b0f25c11ecd","observation_id":"41da7b5e-66d8-4ff5-b61e-2f57760076c8","resolution":{"observed_at":"2026-08-07T15:28:04.443873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:03.429441Z","title":"VoxSim: A perceptual voice similarity dataset,","venue":null,"work_id":"ae06fa91-9ea2-4142-b288-d4e07a1866f4","year":2024},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.779806Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:a72012b8592b501c6e7b81f1626c22e99f10c7167a9558a082a2662106a99e9e","observation_id":"b1532b15-934d-4afe-9c62-277a48251fe8","resolution":{"observed_at":"2026-08-07T15:28:03.451526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:03.898237Z","title":"A Large- Scale Evaluation of Speech Foundation Models,","venue":null,"work_id":"b08077e7-276f-47d7-a8ff-4d23edd983eb","year":2024},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.508013Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:317a94136ab9d7c53f6109ee71ad64a83531b0d8ff4214cd336512de3718cd7b","observation_id":"87b739b1-812e-4f75-9d76-43b334dc497b","resolution":{"observed_at":"2026-08-07T15:28:03.985643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:03.726446Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language,","venue":null,"work_id":"72e8c8d4-7e5c-4d95-a132-ee87322489f8","year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.558645Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:ea9e0c41e460f7b09ed66cacc37860ff643da72304e0815ddb9b521e40e13b2a","observation_id":"fc11a089-7fa0-45a6-b6b9-c2ddf825a917","resolution":{"observed_at":"2026-08-07T15:28:03.805292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:03.631381Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"cc3e243b-259b-430e-a7a0-78347f3f805e","year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.605498Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:b5bbcc437f316bbb1c35148e74071f246cfed3849a73045d2a81fd62554b674d","observation_id":"e82ef2e9-c752-404e-98af-c00c7a450908","resolution":{"observed_at":"2026-08-07T15:28:03.662765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:03.566734Z","title":"XLS-R: Self-supervised Cross-lingual Speech Rep- resentation Learning at Scale,","venue":null,"work_id":"2b589a55-026e-4b40-9fdf-beca3dc6dc44","year":2022},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.647836Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:a1d03632a4ff45f154c80ff10a8b356242f13d35e049975a6f990f762764edae","observation_id":"6f803eb1-b3c2-4419-912d-140668090ed4","resolution":{"observed_at":"2026-08-07T15:28:03.596764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:03.481447Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"c584f9a7-4a55-4996-ad42-d605ead94747","year":2020},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.696851Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:ac619f58b7a52cf535dc782699a3b1c917d2073852c3350def075e73598a9f20","observation_id":"bbc1f6f4-160d-4abb-816d-fa9e27ff09f0","resolution":{"observed_at":"2026-08-07T15:28:03.514832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:03.342495Z","title":"PAM: Prompting Audio- Language Models for Audio Quality Assessment,","venue":null,"work_id":"85ab83cf-2b23-4b82-9322-da3eb56a8f7a","year":2024},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:02.943151Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:c566bcc983de9f3097a38b634e68c4a07863d5281d37e0c8763de27eff1f368d","observation_id":"e3f0447e-2af3-4381-a9c1-b093fdf438f9","resolution":{"observed_at":"2026-08-07T15:28:03.392977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:03.251037Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators,","venue":null,"work_id":"0c2a2736-56f9-4c05-be87-67aab45eddf8","year":2025},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:03.066429Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:c05d6636b4aaf71c9b73e5bc73e83a7e0787c88501c0d476b2136528e8ae9e28","observation_id":"72a379e7-d0ab-465d-ad96-9a05c8242d2d","resolution":{"observed_at":"2026-08-07T15:28:03.305134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:07.924956Z","title":"Each sample was rated by 8 distinct listeners","venue":null,"work_id":"f8b7fb29-ec0a-41f5-8913-8377b92906bd","year":2000},"citing_paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:58.708724Z"},"links":{"citing_paper":"/paper/2505.15061"},"observation_digest":"sha256:7bbed85263889fd962c29531d6fdc94134df74be66e3b7dd6ec8c2496335e3d7","observation_id":"964e5b53-eb6d-44da-b0a7-50f33ac1377f","resolution":{"observed_at":"2026-08-07T15:28:07.963154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15061","last_updated":"2025-05-21T03:30:23Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T15:22:42.403133Z","submitted_at":"2025-05-21T03:30:23Z","title":"SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2505.15061."}