{"as_of":"2026-08-08T11:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5d881f63aa421f8797f0e622b04411d0b283fd70ac1e9850a59cf5fba199800","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:37:50.490245Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:37:49.377109Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:37:50.528467Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"cited_work":{"arxiv_id":"2506.01731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01731","snapshot_observed_at":"2026-08-07T11:37:50.528467Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","venue":"eess.AS","work_id":"fb40b895-ac8b-4a2f-b132-b054c39040d4","year":2025},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:49.377109Z"},"links":{"cited_paper":"/paper/2506.01731","citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:5969b9de5667d08fedf41a07715fb1da38b1937c698a7448e39f1df052ef5539","observation_id":"ec5f048c-dc1e-4e8a-9783-f403fe63fd98","resolution":{"observed_at":"2026-08-07T11:37:50.535308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01731/citation-record","integrity":"/paper/2506.01731/integrity","json":"/paper/2506.01731/citation-record.json","paper":"/paper/2506.01731"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:51.141440Z","title":"Unlike traditional approaches, they use data-driven methods that avoid costly tuning via listening tests [1] but may hallucinate content due to their generative na- ture","venue":null,"work_id":"da91fae4-c06d-4f4a-9064-a35d0fd3672a","year":null},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:49.299114Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:3e3d84991aa233fa6cbf2f6499fdb1639d4b1b1d88e9bac84b8922c5c30b5aa3","observation_id":"b7c22fa6-1ad7-4ad3-945f-25b50ee26ac2","resolution":{"observed_at":"2026-08-07T11:37:51.146176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"cited_work":{"arxiv_id":"2506.01731","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01731","snapshot_observed_at":"2026-08-07T11:37:50.528467Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","venue":"eess.AS","work_id":"fb40b895-ac8b-4a2f-b132-b054c39040d4","year":2025},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:49.377109Z"},"links":{"cited_paper":"/paper/2506.01731","citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:5969b9de5667d08fedf41a07715fb1da38b1937c698a7448e39f1df052ef5539","observation_id":"ec5f048c-dc1e-4e8a-9783-f403fe63fd98","resolution":{"observed_at":"2026-08-07T11:37:50.535308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:51.126196Z","title":null,"venue":null,"work_id":"9a619fad-386d-424c-8ea8-166efd8857b4","year":null},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:49.499579Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:5b4be23119ddb1f5c479e97e58bbb4b8a0c3500f1e5f7264fc8767447a5d14fa","observation_id":"bb9da8be-2c22-48ef-9ccb-ae77a81bd8f3","resolution":{"observed_at":"2026-08-07T11:37:51.130695Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:51.110878Z","title":"graveness","venue":null,"work_id":"a5e0d5a3-c4ba-4702-a3d5-ae9777942fb7","year":null},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:49.672376Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:02d3afc3f44f94e7069152e93f9ede3d9f136f079a65807f1d7873e7d29d8136","observation_id":"165c77f0-2353-4cae-8d75-80e5345682e2","resolution":{"observed_at":"2026-08-07T11:37:51.115377Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:51.095851Z","title":"Unlike speech quality evaluation, DRT offered a more detailed analysis of phoneme-specific degradations and distinctive acoustic features","venue":null,"work_id":"92788c75-37f5-4f75-acae-f555d22c3d93","year":null},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:49.723907Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:c17ec62794acc787de63c91f1f42c442aa2a1a2bc5edd5c794e01ca81f04fb7a","observation_id":"5a304725-9e5d-446e-b348-aa190eb3d233","resolution":{"observed_at":"2026-08-07T11:37:51.100681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:51.080034Z","title":"Neural speech and audio coding: Modern AI technology meets traditional codecs [special issue on model-based and data-driven audio signal processing],","venue":null,"work_id":"349703b0-44b7-42cf-9ebe-d250fd03fc7c","year":2025},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:49.754207Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:56eb1aeea9c244e834ac3db138931bce21be2e20b10ae24556dff4f945700981","observation_id":"85a75a47-c87d-4ffa-948f-d837ae6179e2","resolution":{"observed_at":"2026-08-07T11:37:51.085660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:51.065156Z","title":"Methods for subjective determination of transmission quality,","venue":null,"work_id":"8e413352-a0e9-437b-a91c-06ffed24669a","year":1996},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:49.854416Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:335bdd697eaafcbe5c789bde9d59496dfb269318e00cec5ce64475b8798ab7d4","observation_id":"20c7a175-a175-4573-8ce2-ba0d6a945e79","resolution":{"observed_at":"2026-08-07T11:37:51.069945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:49.905458Z","title":"ITU-R Recommenda- tion BS.1534-3: Method for the subjective assessment of interme- diate quality level of audio systems,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:49.905458Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:6f334e38a4877e58a22dbaf3b28d451bf9555c6486d4f00aae8470c901a3e3fd","observation_id":"7df12455-0dfd-4bd4-a894-1d02372becfd","resolution":{"observed_at":"2026-08-07T11:37:49.905458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.007830Z","title":"ViSQOL v3: An open source production ready objec- tive speech and audio metric,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.007830Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:b76766301d68bb61443928b468c19ca5858e8159619643a156c33515db21a9ca","observation_id":"3e0c2d84-ac56-489b-b5f9-5eafb29500dc","resolution":{"observed_at":"2026-08-07T11:37:50.007830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.123411Z","title":"An algorithm for predicting the in- telligibility of speech masked by modulated noise maskers,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.123411Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:a77b7c72e818ead4cc30ce62f375e5196b4d36dbacb8dbbae67eb391f14303b2","observation_id":"8de353ca-f2ed-49b3-a86d-070acea7e57d","resolution":{"observed_at":"2026-08-07T11:37:50.123411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:51.020849Z","title":"Neural speech coding for real-time communications using constant bitrate scalar quantization,","venue":null,"work_id":"13028bdd-cb69-44f1-a8d9-94448f0ca7cd","year":2024},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.226454Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:4d4860d9b5a7a6b487f502105cf6e1cdb3fb96cf72efdd01c4f2cbed04fc8d90","observation_id":"1d05905f-b00e-45ac-9e4c-35590702d651","resolution":{"observed_at":"2026-08-07T11:37:51.025887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:51.004693Z","title":"High-fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"e2038039-8176-41fd-9388-38ed68a2425b","year":2023},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.278681Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:ebe1448b31bb14d1014dceff640014b504693337b4cdf43dd0a1d03076bec1c1","observation_id":"064914a6-fc93-4213-a91e-51873727d2a2","resolution":{"observed_at":"2026-08-07T11:37:51.010295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.989088Z","title":"Speech quality evaluation of neural audio codecs,","venue":null,"work_id":"0e6b6c2c-78fa-4970-9f4f-1bf5546dee2f","year":2024},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.346264Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:de0255047f9c2cd20cc2c344b9359be00b3fecb9d69065b963e7298df3f0886c","observation_id":"7ff2798c-1291-47b7-b64b-d9a1ebb46e1f","resolution":{"observed_at":"2026-08-07T11:37:50.994489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.974514Z","title":"Quantifying the relation between speech quality and speech intelligibility,","venue":null,"work_id":"1712c112-ded3-4ceb-841d-8230c8854873","year":1995},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.362974Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:5bb70fef29509be8c0fd0193cd236277f079d426711d600da9feee5e256821e6","observation_id":"c83cb41d-59dc-430c-8e47-ca2f9643fb7e","resolution":{"observed_at":"2026-08-07T11:37:50.979243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.958574Z","title":"The SUS test: A method for the assessment of text-to-speech synthesis intelligibility us- ing semantically unpredictable sentences,","venue":null,"work_id":"947c6a92-90fd-4cc9-b0df-0397aeb39d17","year":1996},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.367568Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:095af3f3704f2ec138efafe1f904873c8978f84ca98e34cc9c88c1fc0e1b825f","observation_id":"3461b1a8-0abb-4f49-b488-52d22438aacf","resolution":{"observed_at":"2026-08-07T11:37:50.963737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.941968Z","title":"ANSI/ASA S3.2-2020 method for measuring the intelligibility of speech over communication systems,","venue":null,"work_id":"66ddba1a-f3b8-47e4-ad94-53e2211ee952","year":2020},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.372094Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:f592c192a14c73d8b8f1a9f7dce0c9ff1b73614adcfbd540c2813616c24e4e42","observation_id":"de00a4bd-d737-4b80-b68d-cc917cd49993","resolution":{"observed_at":"2026-08-07T11:37:50.947606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.926457Z","title":"Intelligibility and acceptability testing for speech technology,","venue":null,"work_id":"2c1aff4e-326c-49a5-8bf1-c369e804127f","year":1995},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.376053Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:eb529fef73fb9dab8105a650e18d141e1795db082725bdb4fc34d58329393722","observation_id":"81533cd0-9b3f-4096-910a-f26636cc7ef8","resolution":{"observed_at":"2026-08-07T11:37:50.931986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.910673Z","title":"Subjective test methodology for assessing speech intelligibility,","venue":null,"work_id":"6d11a47b-0fda-4d90-b96f-bb3ef18b42cc","year":2016},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.380284Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:8995de47d78b88c30c4a7762fee412ac4a0352b24ba0916f9bb6169c59f09668","observation_id":"db6b7eeb-4c77-45ac-abdd-b1abf4166fdf","resolution":{"observed_at":"2026-08-07T11:37:50.915729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.893961Z","title":"Subjective evaluation of speech quality with a crowdsourcing approach,","venue":null,"work_id":"80f3fa08-2610-4a5b-90f6-7a882f8c86e9","year":2021},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.385344Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:7b23596b6904ba288d154998e8879286288c3c083f10bbe2d483d3492232718a","observation_id":"09ebcedd-ec87-425b-ba0f-c4a5acf369e6","resolution":{"observed_at":"2026-08-07T11:37:50.899570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.877319Z","title":"Crowdsourced multilingual speech intelligibility testing,","venue":null,"work_id":"cd0802d7-cf6c-4207-9bcc-d81a8ab494e5","year":2024},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.389840Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:06c1841c5955c59639d845e3090858930c5cce5224d184595391641fd7cb3854","observation_id":"e1a4872e-f4e9-4e17-8a4f-a7ed99ebd1e1","resolution":{"observed_at":"2026-08-07T11:37:50.882949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.861511Z","title":"Towards the next generation of web-based experiments: A case study as- sessing basic audio quality following the ITU-R recommendation BS.1534 (MUSHRA),","venue":null,"work_id":"88feb0f2-95c3-44a3-a0a9-abba559f5912","year":2015},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.394200Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:0968faa3df855e125881d9c2171ab3a3fc73a02a04f9412b5632effed45de962","observation_id":"460f993b-f96b-41da-b6bf-55034a83949c","resolution":{"observed_at":"2026-08-07T11:37:50.866513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.845287Z","title":"Drt/***: Programs to administer and score the diagnostic rhyme test,","venue":null,"work_id":"0ae01f12-17e9-48fd-b1ed-ab74f8630c9b","year":1986},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.398774Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:78704cb0140760eb1752a700a43273b46b1d2dabdf833ef83dc3e2ea78a9048d","observation_id":"855375cd-db12-4edf-99cb-f7bd8c428c8f","resolution":{"observed_at":"2026-08-07T11:37:50.850974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.829887Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"06b1787d-2d06-48f7-a9aa-f1d130aa2039","year":2010},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.402997Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:994fb16f08f21e01957df69a90df4ef0fed536521c4317bc4b424421798bf026","observation_id":"6e967768-3f1f-4c8a-83cc-5472e4346014","resolution":{"observed_at":"2026-08-07T11:37:50.834966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.814260Z","title":"Asr-based speech intelligibility pre- diction: A review,","venue":null,"work_id":"451653fb-28fd-47ea-9eb2-d0e930d94614","year":2022},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.407369Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:816dbb90fd32db11b01451f3c0be8c0a12beef86e9cfbd188cbd22ceb7d56391","observation_id":"fca14560-2f9f-4012-8263-6b1842af06db","resolution":{"observed_at":"2026-08-07T11:37:50.819216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.798823Z","title":"LPCNet: Improving neural speech synthesis through linear prediction,","venue":null,"work_id":"bad75b2d-93a5-4837-a573-a7e801c54185","year":2019},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.411848Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:4a9d862c5f2c78234822b8cab63de0376246d741f3136798b9092d7677720dea","observation_id":"332b4ae3-01c0-4de0-985b-8929478b0539","resolution":{"observed_at":"2026-08-07T11:37:50.804050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.415918Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.415918Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:f287ec3a1b171c1fb86741ab7420f233b959ddc2fc324ad31fafe86857a3e523","observation_id":"f6e51a3b-29ae-4db0-b93f-76eec19861d3","resolution":{"observed_at":"2026-08-07T11:37:50.415918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.772737Z","title":"Neural dis- crete representation learning,","venue":null,"work_id":"fa9879e6-1646-4480-8cfb-c49a8ea739ec","year":2017},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.420014Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:5fee873c76815e4184c240259eb8510f7797874a830c7903eb3106e070835ef4","observation_id":"4f38fad2-43fc-4f3b-a91e-d343d2a451be","resolution":{"observed_at":"2026-08-07T11:37:50.778220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.756563Z","title":"Generative speech coding with predictive variance regularization,","venue":null,"work_id":"c7a76f0e-a3cc-4bb6-ba39-99baf57faaa8","year":2021},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.424352Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:25dbf2cf7662cf0ab39f56ed05fe5a39ceeef317cab8f93b5abace17e24733bb","observation_id":"bf71ee7a-1e87-43da-91db-b9f24da47edb","resolution":{"observed_at":"2026-08-07T11:37:50.761489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.428758Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.428758Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:281ca7cd13822fe4b2014f8e342284bb04de08bef18a806803a41ef6eb138543","observation_id":"30a20a8f-6c35-4125-9f58-4af91a171c63","resolution":{"observed_at":"2026-08-07T11:37:50.428758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.730591Z","title":"Low bitrate high-quality rvqgan- based discrete speech tokenizer,","venue":null,"work_id":"9ccdcf06-267d-4e03-bad6-91dd5781a1f8","year":2024},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.432892Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:4bbd03497410a76ad96fdd1a48cfa33b09ccfd1195a760b163472aac4831e9cd","observation_id":"32ed14d2-f1a1-4b51-acfa-479370487dcc","resolution":{"observed_at":"2026-08-07T11:37:50.735826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.715852Z","title":"Generative de-quantization for neural speech codec via latent diffusion,","venue":null,"work_id":"0cfcd9e0-3cc9-4bf4-9fab-ad6fb7f66087","year":2024},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.436987Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:af903d8843ed81dd499bda27f13bc857b6566b4793fa965f60941c6191fa1672","observation_id":"cabfc830-6316-4b46-b5f9-96c4cd3a34bc","resolution":{"observed_at":"2026-08-07T11:37:50.720580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.700906Z","title":"Semanticodec: An ultra low bitrate semantic audio codec for general sound,","venue":null,"work_id":"0826359c-fde9-4fe6-8062-11c18855db2a","year":2024},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.441144Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:0b96ac6f944e17472a3ab534656f7721a1f3d042e23747c96cfe6be4f6829cf7","observation_id":"21c5f568-cd6b-450f-b115-a76752efdd67","resolution":{"observed_at":"2026-08-07T11:37:50.706158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.445411Z","title":"Moshi: A speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.445411Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:148a2ecf4846d9a57754bf8213208dd4ace580dc39d633e860e8a885244389b4","observation_id":"c3b3e37c-e209-4e6d-ad24-8826be12769b","resolution":{"observed_at":"2026-08-07T11:37:50.445411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.676513Z","title":"Ultra-low-bitrate speech coding with pretrained transformers,","venue":null,"work_id":"535c24be-c48c-4da1-a386-6a9887e0e596","year":2022},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.450034Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:3b48e56ddee6b292fdcc5daa2634d0e007f9810d5ad59060e9a9e57763e4e665","observation_id":"a2d895e0-001f-49b7-b8f8-55cb266c8e95","resolution":{"observed_at":"2026-08-07T11:37:50.680416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.663257Z","title":"SNAC: Multi- scale neural audio codec,","venue":null,"work_id":"3589a798-f663-42fc-a888-0d03de545aca","year":2024},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.454747Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:0293f7dd1b1ea1399587ea11ff2edd264a44f2b1b9410e67ad4d77e1df893031","observation_id":"ae88e800-b8e5-496b-8ac6-77b15c1a59d8","resolution":{"observed_at":"2026-08-07T11:37:50.667258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.649201Z","title":"The adaptive multi-rate speech coder,","venue":null,"work_id":"721e0bb5-e428-4cbd-b372-eba89370c3b0","year":1999},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.458967Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:21f18394fe8e8aec6e4dec57cf4b5861cf25cf48a4a5141ff7c7ae771194c187","observation_id":"798d00bc-b70b-497f-9745-08ae37d43228","resolution":{"observed_at":"2026-08-07T11:37:50.653432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.635287Z","title":"The adaptive multi- rate wideband speech codec (AMR-WB),","venue":null,"work_id":"06b4fe9e-318f-48e7-8375-80581ec943ee","year":2002},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.463714Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:e8ba10ea3177dcc17aa4648f709e9133fcd2db6cf064b19c3f07cc06c2bd825d","observation_id":"d0f92372-4378-4e0f-a4bb-28c82a3c3ae3","resolution":{"observed_at":"2026-08-07T11:37:50.639601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.620446Z","title":"Standardization of the new 3GPP EVS codec,","venue":null,"work_id":"a7917314-b0a6-438e-93df-e11f4373cfb5","year":2015},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.467813Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:61ff1494e9c7caa9802626ed6c096408239f33cb470134bd5553176b9a0f1918","observation_id":"4f2a921d-ce0f-4541-9779-dcb824aad13a","resolution":{"observed_at":"2026-08-07T11:37:50.625364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.604583Z","title":"Codec 2 - open source speech coding at 2400 bits/s and below,","venue":null,"work_id":"032c04f4-f405-4924-b84f-b9c0198183f5","year":2011},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.472335Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:c1233dad93a3672f619b51560ac7ed5f1658e8ceeeb00bd10c36fe0f76b1f081","observation_id":"7ca61df2-7806-499e-9b6c-d86e3e1fcc1a","resolution":{"observed_at":"2026-08-07T11:37:50.609376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.589638Z","title":"The AudioLabs system for the Blizzard Challenge 2023,","venue":null,"work_id":"3f19828a-161d-4c2d-b395-6fd94ad79b21","year":2023},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.476621Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:1dc9d805def8e6a83bb67f88a674f4406434c3871a3814f81e10e5be19cdded4","observation_id":"5721dc41-52b2-4611-98c5-0f68c926abfa","resolution":{"observed_at":"2026-08-07T11:37:50.594092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.575626Z","title":"StyleMelGAN: An efficient high-fidelity adversarial vocoder with temporal adaptive normal- ization,","venue":null,"work_id":"5d8ae3b1-0f30-4c7d-8444-72831c4b1212","year":2021},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.481136Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:82cc6d2ff3a82c6f09569f2cb4e754fb91d03cfc2bd3ade50334a63d22490fd7","observation_id":"96573b14-d0ec-4d79-89c5-c8e65ba5da57","resolution":{"observed_at":"2026-08-07T11:37:50.579868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.560784Z","title":"Dataset of sounds of symptoms associated with respiratory sickness,","venue":null,"work_id":"d895dcbf-12cc-4b7d-a667-70dda3c261f7","year":2020},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.486102Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:7c685a5717a89e8634757b4c2e22dda81518f22193cd700b5c0ca84ee9c7f741","observation_id":"a246cee9-3bd2-45c3-9616-f5304df2c7b3","resolution":{"observed_at":"2026-08-07T11:37:50.565161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:37:50.546409Z","title":"V oice analytics in the wild: Validity and predictive accuracy of common audio- recording devices,","venue":null,"work_id":"28183c5d-80d9-4bfe-9090-a2c55e90b18f","year":2024},"citing_paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:50.490245Z"},"links":{"citing_paper":"/paper/2506.01731"},"observation_digest":"sha256:4fb8a1265fb3b17768ecb674a37758ca60317c51065423540df4afdd7f564bbe","observation_id":"6833436a-988f-4da8-9df3-e4d15d56054e","resolution":{"observed_at":"2026-08-07T11:37:50.550870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01731","last_updated":"2025-06-02T14:42:50Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T15:48:39.645181Z","submitted_at":"2025-06-02T14:42:50Z","title":"Benchmarking Neural Speech Codec Intelligibility with SITool"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2506.01731."}