{"as_of":"2026-08-06T09:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20307a622481ded24d8659ddf126dd708ff38039ae7d52f1c0f29621b6940f09","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T04:37:26.452974Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T04:37:26.452974Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T11:06:53.383879Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"cited_work":{"arxiv_id":"2606.04680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.04680","snapshot_observed_at":"2026-07-02T11:06:53.383879Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","venue":"eess.AS","work_id":"3c391678-f7b0-4f89-9381-7a7fa9f691bc","year":2026},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/2606.04680","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:51aef0314a8587c6bc255deeb19e84ffe289caf0b30b76d45bd5f7143d059bf3","observation_id":"180fe86c-654b-433c-95b5-c11f11e801ac","resolution":{"observed_at":"2026-07-02T11:06:53.385236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.04680/citation-record","integrity":"/paper/2606.04680/integrity","json":"/paper/2606.04680/citation-record.json","paper":"/paper/2606.04680"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"cited_work":{"arxiv_id":"2606.04680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.04680","snapshot_observed_at":"2026-07-02T11:06:53.383879Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","venue":"eess.AS","work_id":"3c391678-f7b0-4f89-9381-7a7fa9f691bc","year":2026},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/2606.04680","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:51aef0314a8587c6bc255deeb19e84ffe289caf0b30b76d45bd5f7143d059bf3","observation_id":"180fe86c-654b-433c-95b5-c11f11e801ac","resolution":{"observed_at":"2026-07-02T11:06:53.385236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"ASR Hypothesis Evaluation ASR Hypothesis Evaluation concerns the problem of assessing how well the output of an ASR system explains the original speech signal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:fe178f9b3e6bd90e78c39b14dc2544b240a1c015fc237b20dd1d5e6974bd4cc8","observation_id":"57906eeb-f801-495e-ba7c-52dee052ad26","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"What I cannot create I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:8b6abd39321fbad5b3f5675fce94d747b8ecd54db6794043c5b3c207deddfcf2","observation_id":"0d009c89-1c8a-481e-be0f-d3df5a5aec21","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9418.5618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:06:53.409407Z","title":"R. ”, “Sen","venue":null,"work_id":"7c43b160-bd37-4036-9222-922b13ff70c6","year":null},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:e2da2e22ca81ce7c7a9c7f188be2c7df275e46be0c1e3f0cc2e3a721c911f761","observation_id":"ea44ca7e-72b1-4597-be16-761b4b0072ea","resolution":{"observed_at":"2026-07-02T11:06:53.410898Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"READ is reference-free and requires only the original speech signal to assess hypotheses, indicating fine-grained acoustic discrepancy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:3458d3c6b9d4ee80efc9a52085b6b428159a8b81d3ef9459c677c8f32da81469","observation_id":"33661161-eb5e-485c-a7ce-e62e80974952","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"The authors independently developed the re- search framework and experimental methodology","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:4f34d444ca7638f0044f2f8349cf8479af6b0e6afc70eb9be8bbc5ff999dd49f","observation_id":"0045ce57-6cd1-4703-83f9-b5a25b9d6205","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Confidence measures for large vocabulary continuous speech recognition,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:5a2bd994bd6fdd009b0f186d7ca4e8eb5bee8a328f85e43eba1a5ee685462367","observation_id":"d39ffe0c-542a-44c8-b485-5f5ae95dfd24","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Confidence measures for speech recognition: A sur- vey,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:f325b67b6463b3cfa52e1494bc47e2d6cab445ce2c0405bb7c71f9e14ade6150","observation_id":"fc8d6b5d-aaf1-4b9e-834d-0cc8cfbb9264","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Word level confidence annotation using combinations of features,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:f377448aadc087bbf7190a4e686c05f20f5f6cbbe45da13f7d79aa9432ad0b80","observation_id":"dad8da67-5f4f-4051-b5ad-704d2e991f2b","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"On calibra- tion of modern neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:1be75462b5d7aad9ff1039bc8ebb65a0f1e319ba97e5a7cae97efb391ee7b1be","observation_id":"9a26b4ff-cf35-43a9-8eed-fe599487aa9f","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1210.8440","last_updated":"2012-10-31T18:57:14Z","snapshot_observed_at":"2026-08-03T06:48:10.488630Z","submitted_at":"2012-10-31T18:57:14Z","title":"Large Scale Language Modeling in Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":"1210.8440","doi":null,"metadata_source":"pith","pith_arxiv_id":"1210.8440","snapshot_observed_at":"2026-07-02T11:06:53.403625Z","title":"Large Scale Language Modeling in Automatic Speech Recognition","venue":"cs.CL","work_id":"438288cb-d20c-42bc-9594-73bb412b0709","year":2012},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/1210.8440","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:8c8f95946db5f7bce0267a6fa1fe61db2b21d540a8ffd22df32ff5677fb12812","observation_id":"f155c6fb-5ff1-48e2-bc7a-7e155dc28e1b","resolution":{"observed_at":"2026-07-02T11:06:53.405094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Recurrent neural network based language model","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:729d0a5c714556699358e579cbab47d4dd5ac052b4730fc671c45bc17109b586","observation_id":"aa77f5ac-8445-426b-a52a-fb811c24528f","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Word error rate estimation for speech recognition: e-WER,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:319d0037322a1934516ae93b08bdb7951832f67a40e149fbe450d312c6f8dcf7","observation_id":"7846a626-0c4d-4a0a-8740-817c8455fb99","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"A post-processing system to yield reduced word er- ror rates: Recognizer output voting error reduction (rover),","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:c312b50b01879e4cba8403e210796f728f5be9a280953492e0bcddb2bad976e8","observation_id":"573ea3e2-bdc7-46ee-8d0f-1ff58e872747","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04172","last_updated":"2023-09-29T07:32:03Z","snapshot_observed_at":"2026-07-06T15:51:50.675471Z","submitted_at":"2023-07-09T13:38:25Z","title":"Can Generative Large Language Models Perform ASR Error Correction?","version":2},"cited_work":{"arxiv_id":"2307.04172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04172","snapshot_observed_at":"2026-07-04T06:49:38.798515Z","title":"Can genera- tive large language models perform ASR error correction?","venue":null,"work_id":"daee8702-520c-4773-826c-d7c40d0a3adb","year":2023},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/2307.04172","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:b58e147c7962e6d9496c85dc5dc0b810583dba7701bf37dd1ea33668012088bf","observation_id":"a345f4d9-a582-4936-8669-921f088e026b","resolution":{"observed_at":"2026-07-02T11:06:53.402370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Hyporadise: An open baseline for generative speech recognition with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:df9b4bad357efbbe93e727448010d7a2bc4c234159741bb0ab7d6e01d319111b","observation_id":"bd4dfedc-0837-4c8c-8d51-56a3d11068a7","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Progres: Prompted generative rescoring on asr n-best,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:d98b361cfdbd29de62caa531c94612509083f7b9d5ec86474f5d574a271dd8ff","observation_id":"1bbdba8f-fba1-4400-a188-e8eae28575ec","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Re- jection improves reliability: Training LLMs to refuse unknown questions using RL from knowledge feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:f8ae83165db162a528ce033b77eff60675cee2ce823d05bf6f4c189942368448","observation_id":"e7bbda7e-0c6c-4724-94c1-ca5034029d53","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Word Error Rate Estimation Without ASR Output: e-WER2,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:c427fa36ead170956abfb4d835b6274641547259aa53480f4ddfe26dff786ace","observation_id":"0e7375b7-591f-44da-88b8-b5c81086cdb8","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Fast word error rate esti- mation using self-supervised representations for speech and text,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:8caa14031ef144e5aabd85ee7d1a61999e0b53fbc8ba8e5e80f1cd0408e9b714","observation_id":"44acb57f-5831-454a-a1ec-e3d4f90920d4","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"On the robust ap- proximation of asr metrics,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:5b7befbbbd427cfc5d64f96b2cef7831ce6813425730a0ff667645c925c9f567","observation_id":"003f3b95-347b-478c-abbc-8859000ab9cf","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Large language models are efficient learners of noise- robust speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:f4caed3b5b7d2c4de8cd1104709bf03bba52b2a46a56cfd4f6c5214b1fec2d23","observation_id":"c07b94d6-6bcd-4025-8dec-bb5c83328907","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Listen again and choose the right answer: A new paradigm for automatic speech recognition with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:f555ea67cbebfdc91e673e4216622f97a0bee235180e2815169ccda42d11816f","observation_id":"7f3b06f2-48dd-4ec8-8c2d-91fa521b6bfc","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Speech recognition: A model and a program for research,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:a0c6c594e731b7243aa00e183a9d2e0205c20b68513a6d9a85e5b089b9f57a30","observation_id":"1f03487d-6abe-4ed8-a92e-65d25ff58adc","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:7228799b67f4f8dbbfad42fed47e691c0c5315010dcda19ed7404fdde29f5577","observation_id":"163c29c5-c343-4b2e-b5b1-6ce526311bab","resolution":{"observed_at":"2026-07-02T11:06:53.399558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Semantic Distance: A New Metric for ASR Per- formance Analysis Towards Spoken Language Understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:5216dec9148c48505eaa3630996509df898fc00f2e9f6f26d034c100010a82e2","observation_id":"29ba8f78-6762-4f96-88a4-233340e5f762","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Asr rescoring and confidence estimation with electra,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:a0741b5d5ae98186bec352061e129f9263c0a73b732f9a1b43dd7f4bb51fd4de","observation_id":"3f3bb102-fecb-496d-99ea-bcfedadbd274","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"An evaluation of word-level confidence estimation for end-to-end automatic speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:c79e005dfd16a3fb1a6d833b867f86a220475048af14763a79498d297af54197","observation_id":"434a487c-b1e5-48b6-81cc-873386319611","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:dbe650a6808b435ad23193447865a8e89871888f7f79a4f96442ef844aa6e358","observation_id":"014fecd9-a75e-43d3-99b7-5e12db185c56","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":"2505.17589","doi":"10.48550/arxiv.2505.17589","metadata_source":"pith","pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","venue":"cs.SD","work_id":"ce66e767-526a-419d-bb95-ac019edf4050","year":2025},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:51379d520e525f93019ffbd942dc86eb60a834327c98401a6d4c9f4b462d3609","observation_id":"1544ab3c-9749-470c-9b3d-850a3178cb89","resolution":{"observed_at":"2026-07-02T11:06:53.408220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-05T17:33:03.736753Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":"2502.05512","doi":"10.48550/arxiv.2502.05512","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","venue":"ArXiv.org","work_id":"94f6526d-bd45-4dd3-b4b1-e8f9bb61768a","year":2025},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:72338a289189649ca068c77ef632d33bb3853c77493e117bade6ba4b0a5d6424","observation_id":"8380a461-bd96-48c6-baaa-409dd38bda18","resolution":{"observed_at":"2026-07-02T11:06:53.393587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"A recursive algorithm for the forced alignment of very long audio segments","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:98d35fcc63d44e4f065f23c6dc612742ca1ff9dca6e32b9fbd7bfac9313b7325","observation_id":"fe9acba1-8217-43a3-80c5-c2a938354d4d","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"The kaldi speech recognition toolkit,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:b0a9731e4e0a7a1f2c44782cfcd406aac80918487eb0c775c8ef7d489c0176bd","observation_id":"5cac67bc-26bd-4560-946b-940990db27eb","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:089c4e51f8d2d842c734f3c1ee5c7a3cdb4a653ea21a831a3356734eb089a274","observation_id":"1f4082e2-65af-422b-8e3f-0041761943c4","resolution":{"observed_at":"2026-07-02T11:06:53.392549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Attention-constrained inference for robust decoder-only text-to- speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:4d899fcfb3efae80cc2798e946bd20604106fdc4037b5ad5182ab86b3550caf2","observation_id":"7f4d4fa9-8987-4787-a1ac-96d74b617580","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:1f6f9513abca2654eb94b0249ee2fd57d4be643b32078ce1d311755388bffea4","observation_id":"87845dfc-9904-4f8c-b910-70aae16a9c5a","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Fast conformer with linearly scalable attention for efficient speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:245e9b986c20a7bb0237198300d64cc491c7f7846f98d1e89ff1c64d4892df72","observation_id":"be627e41-244e-442c-87e7-a151e8b75a83","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:7a68bd184d6a11aaa553c429246b82ac27c265d04cab8ee8a367a424046062f4","observation_id":"e181bf22-9821-4065-a60c-c01d426ae1fb","resolution":{"observed_at":"2026-07-02T11:06:53.395584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Lib- rispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:0f7d95fad084fd63753e8741437ce07bc399740be9f482e471d7fdd13638cbbc","observation_id":"961e1b9b-d7cc-4357-9395-eef7cab3ef1c","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"SPGISpeech: 5,000 Hours of Transcribed Financial Audio for Fully Formatted End-to-End Speech Recog- nition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:2d07a2766ae4aab952ab0ade8d55f7a78ad7f11376faa0f59222927fc59f82ff","observation_id":"7518f2a5-38ee-4751-97e8-9222aba3908a","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"Switchboard: Telephone speech corpus for research and development,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:c055813db4771f4d81c12ee15e5ea5ff3ab1ba70c2d4413836195032fa004b32","observation_id":"9236a02a-f808-4554-a58d-6f3d4cfadf0e","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"TED-LIUM 3: Twice as much data and corpus repartition for experiments on speaker adaptation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:a714b87ffa3997954365a0cae1b0024ea57be5e992cc39bd27a6a1ab1390a21a","observation_id":"b91eea58-b7b9-412b-b2f0-f2cdaab76503","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.7488/ds/2117","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Noisy speech database for training speech enhancement algorithms and TTS models, 2016,","venue":"University of Edinburgh","work_id":"8a9705d4-8e44-4e8c-b805-95c9b8fccd8b","year":2016},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:98103ce25d0eb44618a6263ff5e0ddcb2bc4a4f33a05bae567efc79ca1b0f1b2","observation_id":"f4d39e80-c8a1-4768-ac00-6a40f4bbdc3f","resolution":{"observed_at":"2026-06-28T06:21:43.665659Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"The ASRU 2019 mandarin-english code-switching speech recognition challenge: Open datasets, tracks, methods and results,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:285f13b09011098281375b3cc6caf93f6f70f2ae2706f32cc1a7bfa1b25979ae","observation_id":"0be83e94-89cb-48ac-b359-e73758dca654","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"TALCS: An open-source Mandarin-English code-switching cor- pus and a speech recognition baseline,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:0739740e5d1a10a17706d80f38a957afe20e34f15ef5184df1f2c2b0adf26ebb","observation_id":"af4067aa-804c-4ca6-9341-a09adb254c2d","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T04:37:26.452974Z","title":"WHAM!: Extending Speech Separation to Noisy Envi- ronments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T04:37:26.452974Z"},"links":{"citing_paper":"/paper/2606.04680"},"observation_digest":"sha256:c8f194de53aa6046287fe936d9edd91043051c41f08400c97762b5829a48dd33","observation_id":"500d104d-a91d-4c63-8598-c5a4b672da47","resolution":{"observed_at":"2026-06-28T04:37:26.452974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.04680","last_updated":"2026-06-03T10:03:19Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:03:19Z","title":"Read What You Hear: Reference-Free Hypotheses Evaluation with Acoustic Discrepancy"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2606.04680."}