{"as_of":"2026-07-22T01:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fbd22915ffb1704d03356eff04d943989cf89a239db2fd5f2ba44b555a6fb9fc","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T09:46:26.884551Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.08562/citation-record","integrity":"/paper/2604.08562/integrity","json":"/paper/2604.08562/citation-record.json","paper":"/paper/2604.08562"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UTMOS: UTokyo-SaruLab system for V oiceMOS challenge 2022","venue":null,"work_id":"7165276d-490e-4b51-a163-5c6ef21d717e","year":2022},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:7901e3561f076c710706a003432ccb4a40d0656761db4137b0064c4aa401054e","observation_id":"61c536a8-0ba4-4236-be5b-0e981f3f4dc5","resolution":{"observed_at":"2026-05-15T09:49:55.743688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oiceMOS challenge 2024","venue":null,"work_id":"d23312e9-9f1c-4f79-976a-4157199a42e6","year":2024},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:465fd9029a19d8df19232d3a1b320faea264555367f5a24e40d0c4bb95d725e1","observation_id":"673e9db9-e926-47f2-b071-2542a5f82e3f","resolution":{"observed_at":"2026-05-15T09:49:55.734529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-07-06T11:19:03.790556Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":"2106.07447","doi":"10.48550/arxiv.2106.07447","metadata_source":"pith","pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"doi: 10.1088/ 0954-898X_15_2_002","venue":"cs.CL","work_id":"9caaa4c6-8050-4f22-ba70-f6ca40365168","year":2021},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:3d8d1e01e294397bd5a6af6764080601d2ba396c44f628126d38df742b0b8a3c","observation_id":"f7728530-8560-4a6b-9fcb-4bc70517722d","resolution":{"observed_at":"2026-05-15T09:49:54.655165Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08352","last_updated":"2021-07-14T07:32:49Z","snapshot_observed_at":"2026-07-06T07:46:48.062902Z","submitted_at":"2019-04-17T16:38:31Z","title":"MOSNet: Deep Learning based Objective Assessment for Voice Conversion","version":3},"cited_work":{"arxiv_id":"1904.08352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1904.08352","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mosnet: Deep learning based objective assessment for voice conversion.arXiv preprint arXiv:1904.08352","venue":null,"work_id":"1792edb2-db95-4824-995d-b477d7de145e","year":1904},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"cited_paper":"/paper/1904.08352","citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:f1d4967bbbddc3a44dcf575b0ed138f8109a3198177d1ec235cbdf1d75f9bb8c","observation_id":"10b34981-1018-4791-b2c0-c0e76fd61647","resolution":{"observed_at":"2026-05-15T09:49:54.671517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SOMOS: The samsung open MOS dataset for the prediction of synthesized speech quality","venue":null,"work_id":"62a1de27-9a8d-419c-b80a-c4f11a9c6d0a","year":2022},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:2c6b813c2d70eede919d74e86f9d937c11e63fa2b8b0f8e5bbc60e18a4ca58eb","observation_id":"dbdc8cc8-b4f2-450e-ab10-af09588d565d","resolution":{"observed_at":"2026-05-15T09:49:55.746463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DNSMOS: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors","venue":null,"work_id":"063510f3-6b52-48c8-84c7-43ad6a08ed01","year":2021},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:07c37c3d6eb5571ea6ae664a95bc9a2bf1977c8037a04c10ba76f582ccc73188","observation_id":"4f468470-51c7-440e-954a-a496d2c6f175","resolution":{"observed_at":"2026-05-15T09:49:55.732480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.13700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DistilMOS: Layer-wise self-distillation for self-supervised learning model-based MOS prediction","venue":null,"work_id":"7d8e48ee-5019-4750-8d6b-8a9b05e39980","year":2026},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:009f0d948ea45ded4f8a9f510077af5ada832902234969cc613a349f706b085c","observation_id":"91b98aed-305e-48c0-a438-6ca2ca1cf77b","resolution":{"observed_at":"2026-05-15T09:49:54.666254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NISQA: A deep CNN-self-attention model for multidimensional speech quality prediction","venue":null,"work_id":"e0e2f607-26c2-42ec-95ba-d27d178dc620","year":2021},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:f27f28e53c94b39c9a269f82aabf867f98feaf14425a09b4d6ae292289dd0a8d","observation_id":"5ab1aab4-083e-418d-bb73-46b9af2e6031","resolution":{"observed_at":"2026-05-15T09:49:55.738869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural side-by-side: Predicting human preferences for no-reference super- resolution evaluation","venue":null,"work_id":"21a0c7cc-856e-4dba-9be2-4b00a1ace68b","year":2021},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:b4dd5b0ae91b9b75be3b7c188d74c67336d8e830ddbda688468d13a5aed2303b","observation_id":"b4fc9838-1ee2-45d2-af4f-b4ab34e01edd","resolution":{"observed_at":"2026-05-15T09:49:55.741573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"d619a8e5-5f3e-474f-a023-a0ee38b14a89","year":2018},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:ef59823215cbb24fc628acec18a59c44e831e7d32526f88001dd6275d72cac76","observation_id":"7ae38dbf-31a7-4f26-8b39-9b76eaf5a811","resolution":{"observed_at":"2026-05-15T09:49:55.736894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-07-06T15:29:16.851803Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":"2305.11000","doi":"10.48550/arxiv.2305.11000","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"003168ec-b0d0-4979-830c-7df75e11d84b","year":2023},"citing_paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T09:46:26.884551Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2604.08562"},"observation_digest":"sha256:5210845dfa764883c6545c959125c7ab51de5deaa8f76edc6a48dfb97f9a37c9","observation_id":"00bb5a82-a27e-4b68-bd2b-675f021571e6","resolution":{"observed_at":"2026-05-15T09:49:54.660606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.08562","last_updated":"2026-03-17T16:07:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-03-17T16:07:15Z","title":"Neural networks for Text-to-Speech evaluation"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":3,"verified_fuzzy":7},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 11 of 11 outbound references and 0 inbound Pith citation observations for arXiv:2604.08562."}