{"as_of":"2026-08-19T09:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d426eb4b17ece876433bfc049778632f675acc9f25cfd21cdec066b3cbc4ebc7","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T14:38:44.321577Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T14:38:44.321577Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T03:47:35.782666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"cited_work":{"arxiv_id":"2606.10233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10233","snapshot_observed_at":"2026-07-03T03:47:35.782666Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","venue":"eess.AS","work_id":"2beac014-dc13-4a6e-8b34-a97a097bc696","year":2026},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"cited_paper":"/paper/2606.10233","citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:11325174563e95c3a1fd44bae8b09b8f119f1b4b4e107b51e82d33a877e42233","observation_id":"ddaaa18d-1c72-4497-a10d-c340d2b56880","resolution":{"observed_at":"2026-07-03T03:47:35.784188Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10233/citation-record","integrity":"/paper/2606.10233/integrity","json":"/paper/2606.10233/citation-record.json","paper":"/paper/2606.10233"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"This incremental setting mirrors human speech per- ception, where listeners process acoustic signals as they unfold in time rather than waiting for utterance completion [10]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:9df5dcb9e4b4dea45958478a7ee5c15e97857915f1ba5b7c82d222be14144c10","observation_id":"3f4ed257-2621-487f-b453-5869407e97a7","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"cited_work":{"arxiv_id":"2606.10233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10233","snapshot_observed_at":"2026-07-03T03:47:35.782666Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","venue":"eess.AS","work_id":"2beac014-dc13-4a6e-8b34-a97a097bc696","year":2026},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"cited_paper":"/paper/2606.10233","citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:11325174563e95c3a1fd44bae8b09b8f119f1b4b4e107b51e82d33a877e42233","observation_id":"ddaaa18d-1c72-4497-a10d-c340d2b56880","resolution":{"observed_at":"2026-07-03T03:47:35.784188Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Multi-Resolution Autoregressive Modeling ANCHOR extends ARECHO [13] by introducing dual- resolution metric query tokens and a resolution-aware decoding hierarchy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:377321b405ad0de26b09399a63d61b1400f3d0552d3096d7ef1b8f53fef4c3fd","observation_id":"46bffe16-0b99-4bb2-89b1-d16289c8226c","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Dataset and Prefix Construction Dataset.Experiments utilize theOverall Baseconfiguration from [13], spanning 308.8 hours of clean, corrupted, and synthe- sized speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:1b970dea1bb10c3d130433957279ac61e0efb706bce901b2214d2e30b93c48cb","observation_id":"19500ffb-ead4-4ae0-b1ce-f24b3bc41d74","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Chunk-Level: Local vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:ab7437b3a9758f1368a2e064de718c811006f3ae9f0754e951c7f09f3431ec6e","observation_id":"a8a9048b-db84-463a-8c87-951d0168a0f3","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"By enforcing a resolution-aware decoding hierarchy, we mitigate supervision conflict between local and global objec- tives","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:20490485be397dfdfbcc1ee194607b4594525e0b806adc6708a9a995a8bbcd6b","observation_id":"03abdace-38aa-4c10-ad2c-768c05a15c2e","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"National Science Foundation grants #2138259, #2138286, #2138307, #2137603, and #2138296","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:d6e78e2686b5c8eb5a93e8e7553e864c4c3811a9704e2d2da5fe8d000a6dd01e","observation_id":"1c3c7a0d-6d44-4f46-abaf-113073e2e9be","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"All experimental design, analysis, and scientific claims are the authors’ own, and the authors take full respon- sibility for the work and its content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:fbaad57399c5599a6f9bbc3aaf3fc78059c827a8e6d20a84645e504bb604d9aa","observation_id":"ac2fa64e-a555-4594-a394-766c8325243b","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Emformer: Efficient memory transformer based acoustic model for low latency streaming speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:41c7c0e30d0b9b1475f2a0f29d20fc9992f20a9501c3e2a79ee9dada080773e0","observation_id":"3d82ad64-620c-457d-9e7c-3e1c3772e5a2","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Real time speech enhance- ment in the waveform domain,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:dfb725caa445b53789fc82f59e7786c57aad2a81005f08b873901383ea557b95","observation_id":"ce37c635-21b1-47e4-aeb4-d7e2e8b89604","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Tacotron: Towards end- to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:b67b8c137b707a3412e8bd422b03f7001f45235a94bcf037e81d57784e517437","observation_id":"19685006-5f7b-4870-b874-bd069bfcd5ef","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Efficient neural audio synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:8a846297114ee3a83257b67c91aaaf06c69fa7418e2da68e9cc4fb588ecb650c","observation_id":"12eb3f14-c89c-401c-bcbc-926e92c68c5c","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Audiolm: A language modeling approach to audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:c2d5f3f5c6ae121dd22b006e05a821c9a076bd61ecf5838432515bd1b5372b06","observation_id":"a0573f36-edd1-4567-ac74-3ef3fe42efe1","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Speak, read and prompt: High-fidelity text-to-speech with minimal super- vision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:67b8b6e249d7251ac335c4104448724c6e472b30aa302d932486e2cfe152c234","observation_id":"3f9fc366-345d-40b4-92a2-64850544b908","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:4811adc046f448e845a567b89d4253cbb536388cd4e117b0136a6fc4d2d124a6","observation_id":"1ab9cc7b-3877-485e-9508-36e75acdbe9f","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"V oicebox: Text-guided multilingual universal speech gener- ation at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:9794c740df2a84a78a1f2ffe70665f1cc0141512900cc3e173767c0be9a597ce","observation_id":"27b09b1c-59f6-493a-bab1-7c87d66ceaf4","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:2963c841444ec0560eec0dde7dce87c4452079f30e08a3c3a6110f59569193d0","observation_id":"072dae3a-71c9-4f04-96ae-f0dd99b2e979","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Functional parallelism in spoken word- recognition,","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:2852e8a4bd36102ba25aa3420aab5c0a65dac2aa9979bc1e6a8acb9849ff6e5b","observation_id":"cfeda360-4f03-4746-b8f0-aa063a07b710","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Per- ceptual evaluation of speech quality (PESQ)-a new method for objective intelligibility assessment of narrow-band speech signals, in the phone network,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:22476739adec7dfcda48adc57ee05147df7d99d35dff40e5c85efbdb58eafd7f","observation_id":"ef0b9019-aa73-4598-95e4-815f970d8fe4","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"ViSQOL: an objective speech quality model,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:663bd68a0db8e89db339f0152e38d113fb005deabfbcfb7e4e3d4f13a11b8fb0","observation_id":"11e5bde2-264e-4254-97dc-eb6b5ec0edcc","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"ARECHO: Autoregressive evaluation via chain-based hypothesis optimization for speech multi-metric estimation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:3b55a4cfc5537e2aae516b263ccdf1761b0b6dc56dccb12d97dfc8ed623afe5c","observation_id":"0c90aa89-a21e-4099-8809-77c849ceab39","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"An al- gorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:6cd05cd3d8420ff4703f1f2e61a5dd1833529f9dceada0339994b3b7635b39ed","observation_id":"86638084-15fa-4b38-8ccc-891aa8fd5842","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:ceb680563f450a684672d9a17df1086cd84d8a4b7d8633fc5f2b0cee0cc5d424","observation_id":"ade5bd79-7fc3-412b-9bc8-6b1254e1b435","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Dnsmos: A non-intrusive perceptual objec- tive speech quality metric to evaluate noise suppressors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:55a65cbc7118b2ad5f31a40f019e71d4f275edf0c73f6b2e7ad74245a61afcde","observation_id":"d317b58f-b642-4aa0-9409-06b4410b3a2b","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Mosnet: Deep learning-based objective assess- ment for voice conversion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:d6783143d6526072023145c1a8844c5238be2fd78b3d3c5cb7c31e8b91a6274a","observation_id":"085890ed-88f8-4d9e-9796-506dc2454a0e","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"NORESQA: A Non-reference Speech Quality As- sessment metric using non-matching references,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:66f7a4828d87e69137dab77a0176fb118dd4eccee272a38bccccf815f9ae1188","observation_id":"94b410da-7bff-46be-b956-75f925ba6421","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality pre- diction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:5ce9f34b90b26b1c3dc295ac484028bfdb6179a7cc3ac173848d24e0557d717a","observation_id":"55b71f80-4b26-4345-9429-4d5eab2b47ae","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Nomad: Unsupervised learning of perceptual embeddings for speech enhancement and non-matching reference audio quality assessment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:64fc3235302ae55f648c0c73c0b6c8d4fb4e1d8bc39a6d8f8a003203543c7ce9","observation_id":"e151dd61-03f4-4d00-a379-bda8566153e6","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Songeval: A benchmark for automatic music aes- thetic evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:150043dca92762ddc380eedc9fd0b4201f8f82f493a9f2ff55e3238ebb151db1","observation_id":"883b7103-6aa1-4c1d-ae99-0f20b7b44dd7","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Meta audiobox aesthetics: Uni- fied automatic quality assessment for speech, music, and sound,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:110aff809142d1a4e03bda05cbfccd75f24d6b18f14b2cf7c83f7ddcd457e0f2","observation_id":"8f7be793-603c-4d35-a011-ac30aad57b66","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Urgentmos: Unified multi-metric and preference learning for robust speech quality assessment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:c68d3213f80d9aaf41a9922b5a222eec09053d5f5d1ea34bddbf18da973acfe6","observation_id":"11f24525-da0a-443c-8a65-ab5996887690","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Universa: Unified and versatile evaluation for speech and audio,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:ea141e02fb684f0c8dd7d6a1653f5a9b89adc2c5e6531214265e45f67460c0c0","observation_id":"352d8889-0c84-4467-9443-d5c6b360e833","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"To- wards frame-level quality predictions of synthetic speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:c0b4d8abcf1691c133c89cce3327852e8af1ce0bc6c3b81bbd3c2d793bb02225","observation_id":"24a8ad27-17ec-494e-8b0f-f5a2a9637241","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Chunk based speech pre-training with high resolution finite scalar quantization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:5892e1fde1a961e5185ee751cb287d5487bb75898a0fbb29d1740b957441bcd6","observation_id":"14e93bcb-1bbd-47b0-a2bd-182345951b4f","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:5d3ccf98760470b9f643ce12638dd3ac52285ec43329bcf3b6c0d51ab3122bd9","observation_id":"25790b1f-cf2d-4b8d-bf05-1924133ac042","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Streaming automatic speech recognition with the transformer model,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:f07478ea98e8b9dafcc98b50ec03b981a590a669aa650ba4af8bf85fe559dceb","observation_id":"ceb504ad-fa49-4daa-af10-5b5f6fce4019","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Aishell-1: An open- source mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:717ed46aaab86aae94e4c006fe64174fbe6242d7761a4a7e2751842ac9f931e4","observation_id":"9440d489-36fe-40f5-b83e-d8b242bec7bd","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"The ami meeting corpus,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:204a3874c5a887721b862faa6fa6e64c55d00e8bf2ae1077f39291f3145f7c61","observation_id":"d43c2e48-fd6a-42c8-ac63-9c743bc96dff","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:2c0683faa7552bfae2d2b4eeb8fe70231ea1a7df2be95834f69602fd06567b2f","observation_id":"243cd194-353a-45d0-b263-f310e27f4c6d","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Urgent challenge: Uni- versality, robustness, and generalizability for speech enhancement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:a622e9dc3c7e361caec87204d2b6db64ca299a993f061b58af6b3eeb928e8f39","observation_id":"1e9dc2b8-eef0-44b0-9e47-80afb0ae0107","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"The voice bank corpus: De- sign, collection and data analysis of a large regional accent speech database,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:b88d31dc69346d8b53d2193776e80444b9d63596c35a097851bc862414547a56","observation_id":"52c0e043-cb43-4596-adb0-30ca58dbe38c","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"The diverse environments multi-channel acoustic noise database (demand),","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:df23e510e060410d54b4630329b65da2ed7a72e360f1071d55755897a36c3fd1","observation_id":"d8506450-e893-4fe0-9f07-41bb4390ca9c","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"The voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:7a83ed4c75c1cde6f36753b87ebe124c242d9b4be60b9a239f301b120af2c38f","observation_id":"6ec8bb5e-e8f4-4e6b-af16-b545f4f97947","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:5e3a134b99e4f840a91f11fe586a00c4c95692acc755253287f3e9675b3d65db","observation_id":"afc89261-c390-4adf-b902-82136ed85e04","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"XSEDE: Accelerating scientific discovery,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:7d3b9195db21ad8ae74702f0c6f614fa848f986c44ce6adfcfd1a4d568648003","observation_id":"3b95bcd8-5d2b-462e-8ac7-b0664ce123ed","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"Bridges: a uniquely flexible HPC resource for new communities and data analytics,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:c65f7b4ccf0be8f41911a7f58ba1b8902292d6e5a02e40116f3ddb20185f3e9c","observation_id":"d863c121-0604-4db9-9890-bdc5965c8831","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T14:38:44.321577Z","title":"ACCESS: Advancing innovation: NSF’s advanced cyberinfrastruc- ture coordination ecosystem: Services & support,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T14:38:44.321577Z"},"links":{"citing_paper":"/paper/2606.10233"},"observation_digest":"sha256:a9e80875527e67ad351b935d76a39940b734a9d07750345db10bd8e8288d97a4","observation_id":"2417cdfd-50f5-478f-8dcf-4793a4650ece","resolution":{"observed_at":"2026-06-27T14:38:44.321577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.10233","last_updated":"2026-06-08T22:46:30Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T03:43:28.306894Z","submitted_at":"2026-06-08T22:46:30Z","title":"ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2606.10233."}