{"as_of":"2026-08-17T21:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d21494c1bf9ed4fa488a0412ea0e08685164a80559aaacda19d8a5932a9f556","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:41:28.171047Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:53:16.690620Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01336","snapshot_observed_at":"2026-08-03T09:53:16.690620Z","title":"The audiomos challenge 2025,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12222","last_updated":"2026-07-17T09:56:45Z","snapshot_observed_at":"2026-08-16T05:45:36.667116Z","submitted_at":"2026-01-18T02:01:23Z","title":"Song Aesthetics Evaluation with Multi-Stem Attention and Hierarchical Uncertainty Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T09:53:16.690620Z"},"links":{"cited_paper":"/paper/2509.01336","citing_paper":"/paper/2601.12222"},"observation_digest":"sha256:e342d966bed81364ebcf481b6bdd4b303e6a4effecc40e4f6c47dfd72c42a023","observation_id":"08935185-338f-4cbd-a06d-1242a073ac96","resolution":{"observed_at":"2026-08-03T09:53:16.690620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"cited_work":{"arxiv_id":"2509.01336","doi":"10.48550/arxiv.2509.01336","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01336","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The audiomos challenge 2025","venue":"ArXiv.org","work_id":"9b30e49f-bd2f-4cf8-a452-4c6e3cdacdc5","year":2025},"citing_paper":{"arxiv_id":"2605.04505","last_updated":"2026-05-06T05:18:42Z","snapshot_observed_at":"2026-08-11T06:20:33.479992Z","submitted_at":"2026-05-06T05:18:42Z","title":"JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T16:43:33.397158Z"},"links":{"cited_paper":"/paper/2509.01336","citing_paper":"/paper/2605.04505"},"observation_digest":"sha256:a61b2856848170f6598c94283f5e89ab86ee1c731cc9a37d65e41547ba30e7fe","observation_id":"e76adabc-464e-4244-bdcb-bf4f0b2cb540","resolution":{"observed_at":"2026-05-11T18:01:08.480283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"cited_work":{"arxiv_id":"2509.01336","doi":"10.48550/arxiv.2509.01336","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01336","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The audiomos challenge 2025","venue":"ArXiv.org","work_id":"9b30e49f-bd2f-4cf8-a452-4c6e3cdacdc5","year":2025},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2509.01336","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:9c424a663dd9f38efb6c62073d3743d37e09b7c11c2e4dc02a7f6a294fb1d1f9","observation_id":"a724a6a2-505c-4287-aab0-d21125a9daa1","resolution":{"observed_at":"2026-06-30T22:15:05.494952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01336","snapshot_observed_at":"2026-07-14T13:57:36.846479Z","title":"The audiomos challenge 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10146","last_updated":"2026-07-11T06:10:17Z","snapshot_observed_at":"2026-08-17T16:17:56.784137Z","submitted_at":"2026-07-11T06:10:17Z","title":"Evaluating SSL and ViViT Architectures for Cross-Corpus Audio MOS Prediction via LODO Validation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T13:57:36.846479Z"},"links":{"cited_paper":"/paper/2509.01336","citing_paper":"/paper/2607.10146"},"observation_digest":"sha256:7eff5e4ac3605d8782ca973adf15a712259aeb4dc6b93b628a5ee7780bfdf5cb","observation_id":"92cc6aa3-c70b-470b-8915-a73b1bfc21c0","resolution":{"observed_at":"2026-07-14T13:57:36.846479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01336","snapshot_observed_at":"2026-08-01T20:33:36.029311Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16599","last_updated":"2026-07-18T02:34:46Z","snapshot_observed_at":"2026-08-16T01:02:14.116543Z","submitted_at":"2026-07-18T02:34:46Z","title":"Is One Score Enough? Assessing Singing Quality of Songs with Temporal Score Curves","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T20:33:36.029311Z"},"links":{"cited_paper":"/paper/2509.01336","citing_paper":"/paper/2607.16599"},"observation_digest":"sha256:a26be5f7c7cb48fe6244292ac34a9553c1fb78db1c32753f93ccebf3633585b3","observation_id":"e086a207-662d-4702-8c06-a55293b673a3","resolution":{"observed_at":"2026-08-01T20:33:36.029311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01336/citation-record","integrity":"/paper/2509.01336/integrity","json":"/paper/2509.01336/citation-record.json","paper":"/paper/2509.01336"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:24.747365Z","title":"The V oiceMOS Challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:24.747365Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:7e2fd95ba813c62b875dd82e38b0635e8e631d176b1aa9dd284b5d60900663e7","observation_id":"71747265-4239-494d-9b26-0d3a57761db5","resolution":{"observed_at":"2026-08-05T12:41:24.747365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:29.101067Z","title":"The V oiceMOS Challenge 2023: Zero-Shot Subjective Speech Quality Prediction for Multiple Domains,","venue":null,"work_id":"736db7f2-0997-45b2-aa65-b36b7fd3068b","year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:24.803002Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:b94919a1bc8298cad57c1b9db005a95799c8be6ff68b578a039b6e703827dbb8","observation_id":"75c08112-cd56-493a-bcd9-95ed609c0cf4","resolution":{"observed_at":"2026-08-05T12:41:29.105692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:29.085830Z","title":"The V oiceMOS Challenge 2024: Beyond Speech Quality Prediction,","venue":null,"work_id":"6f521a2f-31f3-4509-8276-ec68cfe687dd","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:24.838581Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:e79830a5ca2f07dec15ab9e5adaeef75e83f42e5681f417a3d0723413ea7601b","observation_id":"9f15f70c-f59e-4775-97da-fec479570f35","resolution":{"observed_at":"2026-08-05T12:41:29.090267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:29.071399Z","title":"How do voices from past speech synthesis challenges compare today?","venue":null,"work_id":"84d92f54-d49f-4cbc-9758-846d3a4e1894","year":2021},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:24.911721Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:060a59987076fe35bffd8ef6d989067b9dd38e606f69f45ad9a8e41d31172e99","observation_id":"bfbc1959-0a0c-4d00-8ae3-09eb3a872dc6","resolution":{"observed_at":"2026-08-05T12:41:29.076034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:29.056570Z","title":"Fr ´echet Audio Distance: A Reference-Free Metric for Evaluating Music Enhancement Algorithms,","venue":null,"work_id":"02944d6d-4fc8-49c3-a23f-4537a85b0305","year":2019},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.018687Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:83a9eb561712d25347e089821bb570564b52db305b643a9cb124bec00b21e074","observation_id":"9fee816d-8cca-43a4-89c3-636f263db927","resolution":{"observed_at":"2026-08-05T12:41:29.061380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:29.039539Z","title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models,","venue":null,"work_id":"64daf0ab-ad6b-4660-9808-7bf52c03dbbe","year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.099194Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:827ec0647dc5b328d495a5ee8d67596a0a916e365038de8533764a3b1ccb9887","observation_id":"7d788b0d-7c87-4918-9c0b-ce177cd587fc","resolution":{"observed_at":"2026-08-05T12:41:29.044903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:29.025118Z","title":"Evaluating generative audio systems and their metrics,","venue":null,"work_id":"2bf0d270-814d-4a1c-bf5a-d0bcfd578272","year":2022},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.176618Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:71c5acde410fdd30c920de08379013de20603424294d8c4b6051e7bd9d7906b5","observation_id":"8cf02930-b725-4b01-84d8-8d5c8ef8c35a","resolution":{"observed_at":"2026-08-05T12:41:29.029625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:29.009633Z","title":"Correlation of Fr ´echet Audio Distance With Human Perception of Environmental Audio Is Embedding Dependent,","venue":null,"work_id":"3138ef4a-b95e-4c55-8916-1d1fb554881a","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.264913Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:e6888d01aadf568a67a182e38054d670fd0a22bdf45649cb6e3b144bfad65f5a","observation_id":"444c3028-1fea-4c8b-ad67-517eb4e10b73","resolution":{"observed_at":"2026-08-05T12:41:29.014505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-17T16:15:29.907985Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-05T12:41:25.350124Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.350124Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:025184e9d04283678028a4f622d4dc77951bc711e97915cdbf7b5747988835a6","observation_id":"afbd36a3-ac50-4275-8770-a90feaf8348b","resolution":{"observed_at":"2026-08-05T12:41:25.350124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.991029Z","title":"MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation,","venue":null,"work_id":"adb5eb24-9e24-4856-966b-9e114eb73574","year":2025},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.426012Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:baa0359636159efc2d782ce079c2125bb0ab664f8234aaa491768c40d6ca603b","observation_id":"076c667e-3f55-40e0-b9fd-ef547b50bbd3","resolution":{"observed_at":"2026-08-05T12:41:28.995782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.974879Z","title":"LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning,","venue":null,"work_id":"2d09c2d4-9ec1-43aa-8c56-628518e691dd","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.499732Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:b79a00eb10f9e0532eff33969736ae8bdd427fb4dca6e629bc63b544daa793f8","observation_id":"8a45dfc5-e190-4e62-8d36-03f44096efd7","resolution":{"observed_at":"2026-08-05T12:41:28.980192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.959122Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"00c5256e-0210-454d-9d46-32f23fd405a2","year":2019},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.614593Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:b652fa837c6aa2f9212ae8077b0566c0868d3933acf3b1fb999c25070e7f9942","observation_id":"3c74dd48-e844-46c3-a5f3-b34603c82a54","resolution":{"observed_at":"2026-08-05T12:41:28.964053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-17T00:33:41.369960Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-05T12:41:25.791485Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.791485Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:7d3c79a504754e9058d950371b1c22e3f3f4fd3d0e27f308a4c141dcd9800195","observation_id":"6257b821-5018-4178-97e7-df8164efd9b9","resolution":{"observed_at":"2026-08-05T12:41:25.791485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.943453Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus,","venue":null,"work_id":"d9f5300f-2aaf-4170-9828-c736a84486a1","year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.897729Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:dfeecf5a9eaadc8696ca38ebebafc7eff03ebe23ef566be95e3e649f353a473b","observation_id":"094207ec-0676-478b-b7b7-cc10dc9b3636","resolution":{"observed_at":"2026-08-05T12:41:28.948461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.927547Z","title":"Hi-Fi-CAPTAIN: High-fidelity and high-capacity conversational speech synthesis corpus developed by NICT,","venue":null,"work_id":"4eb6408d-2b24-44dd-a53b-a91763a2344f","year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:25.973158Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:2addf72498390f8a2c6fd3f0c84d5af66264c0846b223b99a736c8584f8a30e6","observation_id":"8a3ff8ec-1567-4005-a81d-116bb2d934fc","resolution":{"observed_at":"2026-08-05T12:41:28.932801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.910971Z","title":"World: a vocoder-based high-quality speech synthesis system for real-time applications,","venue":null,"work_id":"57d7a6dd-2ca2-40cd-a3da-c9ab37c8afe1","year":2016},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.096740Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:47ef362b0ac90ff7cbe398cf3d3550d85ad5ecbe8f6ce1ac2848419a53725198","observation_id":"35552078-7a96-431f-94bc-d8529290e268","resolution":{"observed_at":"2026-08-05T12:41:28.915871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.892192Z","title":"Fast Neural Speech Waveform Generative Models With Fully-Connected Layer-Based Upsampling,","venue":null,"work_id":"4f53e9f7-c91f-457b-a3c4-1f9ca9a1b314","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.238332Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:8e54f47a1dd376ae968bf9fb447110642f44d2f30590d2bf78b0b4762be15aff","observation_id":"c59f6e4b-80de-434f-b4ad-d173d91396c7","resolution":{"observed_at":"2026-08-05T12:41:28.898082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.873881Z","title":"Speech masking system based on spatially separated multiple TTS maskers with a compact circular loudspeaker array,","venue":null,"work_id":"f83afeb0-96d8-4ede-83a7-b3609a51ad81","year":2025},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.300292Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:902063d4b37340ab3df63b60feb65fde63eb716082131183f574335ffcfd1e48","observation_id":"1716e873-33db-4514-9b46-f6a1c648661a","resolution":{"observed_at":"2026-08-05T12:41:28.879302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.855591Z","title":"AudioSR: Versatile audio super-resolution at scale,","venue":null,"work_id":"c7998847-c7f4-467d-bcba-fbd990782d9f","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.410771Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:1a613b4211856f80f2c07d8504114ed6c27a1c48f47554a1dabfae2840f127d0","observation_id":"a4f16271-e27a-455a-bb07-aa84247e09b7","resolution":{"observed_at":"2026-08-05T12:41:28.860470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.840191Z","title":"pyloudnorm: A simple yet flexible loudness meter in python,","venue":null,"work_id":"e73a5a9f-924c-45d6-974d-26eb7616f207","year":null},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.520713Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:2562a52b7a4b74108d42c36b37a224c29dd408a137a4e8f963e83e6386454436","observation_id":"e0184f3c-dd9c-48ff-9dc4-9d0c847682df","resolution":{"observed_at":"2026-08-05T12:41:28.844989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.809225Z","title":"Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation,","venue":null,"work_id":"7879ed85-c5eb-4ad5-b2f2-9d63f7a1ac5c","year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.671368Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:dc3b5b1b90a63cb8f8087b5b2a94d632f7a72f7070d9547e304b8abbc4748056","observation_id":"7056e9ba-8ce3-49e2-a2c5-c4e50924387a","resolution":{"observed_at":"2026-08-05T12:41:28.814314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.792495Z","title":"HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection,","venue":null,"work_id":"ba2ae003-b981-4d98-8749-6b0989c10e5f","year":2022},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.767113Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:c846d352e7f36e146f64ac808df2198f20afa5745427d58502bb636d81980bc5","observation_id":"ed998dd8-45e3-4d88-a9e8-13eed8541ef6","resolution":{"observed_at":"2026-08-05T12:41:28.797594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:26.859550Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.859550Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:14026cb51d273851eaf46de5cd628abd2827882c7ff1d3665ce9ede47bd12838","observation_id":"0a6684ce-f2dc-4ee8-ad7d-d7ddcc3aa8c1","resolution":{"observed_at":"2026-08-05T12:41:26.859550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:26.890826Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.890826Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:82b94787e97b930c11b689ef34e2fe6baae771331f01272342f254abb49f6e77","observation_id":"172d95ca-1a10-4e60-866c-eebf56c26229","resolution":{"observed_at":"2026-08-05T12:41:26.890826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T12:41:26.917094Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.917094Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:506c1151167bb18aacfd2b982b1be217bbf3eb5e41fa07cb121e673e71679340","observation_id":"17a12fbd-41de-4400-bc07-6938649d4dfb","resolution":{"observed_at":"2026-08-05T12:41:26.917094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T12:41:27.079074Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.079074Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:501b21d6144cd840fa8457151906966714879436e241d031d1ca52fcb391ac1a","observation_id":"9500da5a-ebd8-4855-b507-6863ad5ae1ad","resolution":{"observed_at":"2026-08-05T12:41:27.079074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:27.140555Z","title":"Generalization ability of MOS prediction networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.140555Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:61d1544300e5ee082a289c5fd19bf59b1afc2aa369ae6b39d34ba632cd52ea35","observation_id":"a227ea61-bb4b-4bb2-ae57-34891ddc50c2","resolution":{"observed_at":"2026-08-05T12:41:27.140555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.743676Z","title":"PAM: Prompting Audio-Language Models for Audio Quality Assessment,","venue":null,"work_id":"7a7640df-45da-4808-b619-4f2988f1a572","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.250841Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:745ccade8a59ab3a82f761f189aa123a235ba7c6d7429f36f2c62cd984fe7f61","observation_id":"3b1348ed-832e-45ef-9242-286d6553fe4c","resolution":{"observed_at":"2026-08-05T12:41:28.748591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.728832Z","title":"EARS: An Anechoic Fullband Speech Dataset Benchmarked for Speech Enhancement and Dereverberation,","venue":null,"work_id":"6ad009d0-f3f0-4d26-ab11-b345f58258c2","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.363762Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:15b682e7d269b01cab63d60dd6725663e2ce0bb22622ad0ce4cf74884d3cad2b","observation_id":"818ff978-f69d-4b09-9641-8cef1b9b56b2","resolution":{"observed_at":"2026-08-05T12:41:28.733512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T12:41:27.466107Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.466107Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:985e9f6e9a78c43ce5f6db8dd6d47dc00cd8fe36acf7b406d8f6b5b353c8e724","observation_id":"4cb3aca0-b399-434a-b226-15d309c40397","resolution":{"observed_at":"2026-08-05T12:41:27.466107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.713369Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers,","venue":null,"work_id":"d68e99e1-622e-4080-8116-c77a2e83ca38","year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.569724Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:a9125e0e7ca5fbb9fe08d3c9e9a42adc48968b95de250b894cb73a39d2bc0c1b","observation_id":"26bc3c32-a67e-4203-96cb-347d0b747098","resolution":{"observed_at":"2026-08-05T12:41:28.718092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.699054Z","title":"Masked Modeling Duo: Towards a Universal Audio Pre-training Frame- work,","venue":null,"work_id":"a4b5837a-91c4-499a-bd31-654c3d90388e","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.684183Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:7b4b02dcb70534a58cc53917ad20bc8aaa5a9929c4122a810a79b20630d820f6","observation_id":"67cf87db-4185-409f-a2b8-e18bf6b0b21e","resolution":{"observed_at":"2026-08-05T12:41:28.703862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.680337Z","title":"High Fidelity Neural Audio Compression,","venue":null,"work_id":"8a618ca6-15ce-4bcd-879b-c183412e33d3","year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.738336Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:ed4b284edd6c2f1c82b8aac8361995a5c93555878c203d663007e2e795ffe4e4","observation_id":"7eee63f3-1fd0-41d5-aff8-9dea27ca73bf","resolution":{"observed_at":"2026-08-05T12:41:28.685458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.663708Z","title":"Scaling up masked audio encoder learning for general audio classification,","venue":null,"work_id":"542e3e96-24cf-4dc8-8154-f6090899a369","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.798487Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:8bc444f62966014f32c8ef863a57d2ce966357ea9debd4aaa33cc9500b59723e","observation_id":"fbd19bd8-0b75-4f1e-8863-3654bf650e33","resolution":{"observed_at":"2026-08-05T12:41:28.669001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.648953Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training,","venue":null,"work_id":"4ac177a8-5926-476a-b464-ffa0a9779141","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:27.960529Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:fc9cd8ca80cf6f3de6d6239416fc7342d609e8768a2bc30eb18b6cac3e297164","observation_id":"2c3b9206-cf74-418d-a760-716d816c152c","resolution":{"observed_at":"2026-08-05T12:41:28.653507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01108","last_updated":"2025-01-03T08:35:34Z","snapshot_observed_at":"2026-08-17T12:58:40.139613Z","submitted_at":"2025-01-02T07:08:29Z","title":"MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01108","snapshot_observed_at":"2026-08-05T12:41:28.086037Z","title":"MuQ: Self-supervised music representation learning with mel residual vector quantization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.086037Z"},"links":{"cited_paper":"/paper/2501.01108","citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:438c1e0b1c51ae7704e1bab923fb5d897119bc7532d8ea1216acf20ecfc171e1","observation_id":"9ea7b282-98af-4e89-a446-fe71f12d221b","resolution":{"observed_at":"2026-08-05T12:41:28.086037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.634268Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"d7032034-498a-45b4-99b5-1072e2096193","year":2019},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.091853Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:3871a0b165c17cd93bd2e2fbfc3d945a49b1b12b86bb103afc00f8da39ede387","observation_id":"1808c671-6225-400b-8cb7-30eecc0d2c3a","resolution":{"observed_at":"2026-08-05T12:41:28.638751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-05T12:41:28.096665Z","title":"RoBERTa: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.096665Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:2dc6c45fa694e695278611c7896a8a02adc71989edd7ba72197455625f62e6f8","observation_id":"371f0a5f-9676-4638-98b1-7420db71a21b","resolution":{"observed_at":"2026-08-05T12:41:28.096665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T12:41:28.101543Z","title":"Qwen3 Technical Report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.101543Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:db3d6fab90e74a37841d53ba835d581cd154c4b3cc100bcbe818b2bb9f2f85de","observation_id":"717265ef-56f9-4984-845e-912e8ccf3430","resolution":{"observed_at":"2026-08-05T12:41:28.101543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.619628Z","title":"Robust Speech Recognition via Large-Scale Weak Super- vision,","venue":null,"work_id":"f29324dc-531b-4803-bda0-4784b4b7938f","year":2023},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.106411Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:36a6d16d279b8c670aaa19b619c4bbe7fc28de6e1ffeb19c00abeb6e40ffb447","observation_id":"decdce1d-cc57-4be4-9034-0b74cec2acf4","resolution":{"observed_at":"2026-08-05T12:41:28.624216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.603622Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":"3cb449f5-3baf-4543-b1c5-eaeadfcb1f31","year":2021},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.111341Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:9a6d42565fab0308df60b51c0d3f11b8ac515c781543273528a284b0fe74047e","observation_id":"242f1acb-fb3b-437f-ac5d-02f21b625cce","resolution":{"observed_at":"2026-08-05T12:41:28.608435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.584811Z","title":"Scaling Speech Technology to 1,000+ Languages,","venue":null,"work_id":"498462ee-c013-4908-871d-94b208542219","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.115839Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:b4b950490f737d49f6c14fd0baa90253b81284258afa5452f2d5a23fcc9f3278","observation_id":"44ff0cea-57f8-4d50-ab61-f525cc04c564","resolution":{"observed_at":"2026-08-05T12:41:28.590327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.563908Z","title":"EAT: Self- Supervised Pre-Training with Efficient Audio Transformer,","venue":null,"work_id":"f59628c2-62c3-47e0-bc5b-6ce7267d1c55","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.121108Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:2593ceff5d60cb7728619eb8851b0666f0c28b54cd20bcbf408b6a50156b01f5","observation_id":"30883e1f-8453-4819-b884-c147b9987d9a","resolution":{"observed_at":"2026-08-05T12:41:28.571687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.542998Z","title":"LDNet: Unified Listener Dependent Modeling in MOS Prediction for Synthetic Speech,","venue":null,"work_id":"21537e25-9b22-4219-bba7-d2221ec3dd60","year":2022},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.126326Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:222fe39bd5fb67d332ffe79c7236cb15fc4aa46cd9cf20c3c0c077b7125bf600","observation_id":"66f7ec39-c620-4676-9128-c3b5ad480448","resolution":{"observed_at":"2026-08-05T12:41:28.549925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.520110Z","title":"KAN: Kolmogorov–Arnold networks,","venue":null,"work_id":"49d5d7ac-fa3d-4050-8a72-64148928bd88","year":2025},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.132640Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:01d5831e6120258e021a07d6db9cf2caee549701f92641facde9c0aa52c26626","observation_id":"a147eebb-9fd7-4379-9024-91c8fc04aa03","resolution":{"observed_at":"2026-08-05T12:41:28.527216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.499724Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality,","venue":null,"work_id":"a97c7683-f518-4b6b-ae66-9d2aaf0bc013","year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.138856Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:961708d3c8981aefdfd326cdec6b9b67c8239e70926f17e602f81fc8f5a09f67","observation_id":"9688a5e9-93bd-485b-a80f-a456901d0779","resolution":{"observed_at":"2026-08-05T12:41:28.505271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.476836Z","title":"Sampling- Frequency-Independent Convolutional Layer and its Application to Audio Source Separation,","venue":null,"work_id":"c73fcbe7-4e5f-437f-b0ce-b2de8d63647c","year":2022},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.144515Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:6c0fd1dab0df7297008d3275f6e37f5b554968408f9e5e7619e13f27b0cba9f1","observation_id":"5555346e-949e-49d5-b1bb-a279437c8bdf","resolution":{"observed_at":"2026-08-05T12:41:28.484447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10594","last_updated":"2024-09-16T17:54:51Z","snapshot_observed_at":"2026-08-16T13:18:05.122434Z","submitted_at":"2024-09-16T17:54:51Z","title":"Kolmogorov-Arnold Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10594","snapshot_observed_at":"2026-08-05T12:41:28.151523Z","title":"Kolmogorov-Arnold transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.151523Z"},"links":{"cited_paper":"/paper/2409.10594","citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:f30d552d03507dde6c5c9fb6a38327260a8359036cf7fb8e159dc62251088090","observation_id":"68362bec-02a2-44b1-b7d7-fc29fbe516ec","resolution":{"observed_at":"2026-08-05T12:41:28.151523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.451794Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music,","venue":null,"work_id":"b5ac1194-b621-4fe1-be24-895bcc32ae18","year":2025},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.157430Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:d03dea3ca11120ed2692d2ffa8784c6543de39eb60b4b18d2c4cb92c84583a8b","observation_id":"a58e257f-295f-4f00-9adf-156dd1676430","resolution":{"observed_at":"2026-08-05T12:41:28.457972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.431643Z","title":"XGBoost: A Scalable Tree Boosting Sys- tem,","venue":null,"work_id":"ddc36803-249c-4ff9-b6f7-8f1d57888702","year":2016},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.165507Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:13214120054e12ee2b7ffef0276e6ab9df9fa74a495ffec9b92f4dc9e508dae9","observation_id":"fbbb3225-c21b-4a2a-afb7-d2c1f8254618","resolution":{"observed_at":"2026-08-05T12:41:28.436635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.411420Z","title":"Pseudo Label Is Better Than Human Label,","venue":null,"work_id":"32f42830-acf3-4a61-be65-3011176b8526","year":2022},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:28.171047Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:e8d5f351d60180d7768bd342d945b43977daf2da086f1e9e3016b9b19631789c","observation_id":"37341450-6e5d-4fa2-9674-b6724494b15c","resolution":{"observed_at":"2026-08-05T12:41:28.419805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:41:28.825101Z","title":null,"venue":null,"work_id":"7f8980db-ef37-465d-94c6-ed6a2446b1cf","year":2021},"citing_paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-05T12:41:26.598556Z"},"links":{"citing_paper":"/paper/2509.01336"},"observation_digest":"sha256:c88568b2d6c9c95556875cc86a09153b7e201c3c8fefa392035b320040c925df","observation_id":"635d2866-4a97-49a0-9603-f6d928cb71e9","resolution":{"observed_at":"2026-08-05T12:41:28.829801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01336","last_updated":"2025-09-01T10:18:14Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T15:32:09.738068Z","submitted_at":"2025-09-01T10:18:14Z","title":"The AudioMOS Challenge 2025"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 5 inbound Pith citation observations for arXiv:2509.01336."}