{"as_of":"2026-08-08T06:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6468d2c4fd884dce349abecb1a0b38d260f82b325debee1bcc3fbd21182b3f4e","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T21:20:16.428207Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T21:20:16.428207Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T20:16:12.170480Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"cited_work":{"arxiv_id":"2605.30899","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30899","snapshot_observed_at":"2026-07-01T20:16:12.170480Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","venue":"eess.AS","work_id":"600ebf1b-dc80-40c6-9b1f-d4b390b450b6","year":2026},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2605.30899","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:9adda9f7e6fdc73742ea575a5b87ec6f36f8ba129dd35f62463f15cbd97c0138","observation_id":"a08b0b3f-88ad-4c12-b587-f550f99826ed","resolution":{"observed_at":"2026-07-01T20:16:12.171901Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.30899/citation-record","integrity":"/paper/2605.30899/integrity","json":"/paper/2605.30899/citation-record.json","paper":"/paper/2605.30899"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"cited_work":{"arxiv_id":"2605.30899","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30899","snapshot_observed_at":"2026-07-01T20:16:12.170480Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","venue":"eess.AS","work_id":"600ebf1b-dc80-40c6-9b1f-d4b390b450b6","year":2026},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2605.30899","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:9adda9f7e6fdc73742ea575a5b87ec6f36f8ba129dd35f62463f15cbd97c0138","observation_id":"a08b0b3f-88ad-4c12-b587-f550f99826ed","resolution":{"observed_at":"2026-07-01T20:16:12.171901Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"paper + code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:332b9b3c84d1e131496c9ca4bd301bce3fb2cabc828380044b459a6c7ad7525d","observation_id":"c5ac17ea-1c7a-4c73-8da7-278055a21a5c","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"paper + code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:aee37f4611042868c16858d54d317043a1f7ddee94367c6d3b9751a0f80f2857","observation_id":"611098ca-aa15-45f7-baa9-c4075538a39b","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7492.0259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:16:12.176250Z","title":null,"venue":null,"work_id":"d572f04f-edc2-4f90-a66b-ca2b634b4ad3","year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:2544ba0194a5187b98abb0493742357a40cf9d1e577d01ceaa5990ba1a2ed608","observation_id":"7ca8c767-824d-4dfa-9268-2b79bd94ea7d","resolution":{"observed_at":"2026-07-01T20:16:12.178153Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:4674e7e534ee6b8d7b13f5399d9f3f881745f935886f60280751239f38abb310","observation_id":"ee1d9c1a-8bdc-4c60-83e3-9b3540d6affb","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"paper + code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:09b165c9a8f0abb0ee8e115670fb12574b550e58b8f411a349be1ade97e39bf1","observation_id":"cad2034d-c349-4852-9d23-293119a8e38b","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"pa- per + code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:a64c52a8a5d34aa6d44cd56ab2378e12fb6ece802134374d4a8f4263ceac2bf5","observation_id":"f0ce2598-9a3d-4844-8d93-f8ecb5b7b572","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"On the landscape of spoken language models: A comprehensive survey,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:b8543c7d6a5ebe891a7f4a71823eda61b2871e1d6da146125ca0c8541a96d2a8","observation_id":"1b46f2b4-f9bf-42b8-b641-69056181a1fc","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2504.08528","doi":"10.48550/arxiv.2504.08528","metadata_source":"pith","pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","venue":"cs.CL","work_id":"92746bbc-1fe6-410d-a1e9-8afab3e0a8e5","year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:df493fb45d2fe936f008006aa1d77a9619660c5b8608a4ab73798db31f811d04","observation_id":"b6ef50bc-739b-4261-913d-0f7de7a8ab23","resolution":{"observed_at":"2026-07-01T20:16:12.174887Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.364053","doi":"10.1109/jstsp.2025.3640535","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on speech large language models for understanding","venue":"IEEE Journal of Selected Topics in Signal Processing","work_id":"2cea22c9-43e0-4250-b32f-46ff127e5402","year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:17d09f7ef8a84daaff9a4599ab2cdcc5265abe53ba0ec9ac26f3554da9503c86","observation_id":"c9fedc37-37d6-4cd0-9544-9e7b67f2dd62","resolution":{"observed_at":"2026-06-28T21:22:38.016455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Measuring the accuracy of automatic speech recognition solutions,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:2de53659cbfc539d0dd1194bf6d8173136753676e0b80049510a4cecc0923cd3","observation_id":"fcbbb6b4-3be4-4ff5-bf22-cfe277e9552e","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3636513","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le Page, R","venue":"ACM Transactions on Accessible Computing","work_id":"96ccf4eb-d4ec-4fc0-bca3-65cafccd478f","year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:22ac65abd6840cae5a51c263ae9d45c4ca1f18956c920181df7cc33c8a17ccae","observation_id":"34581df1-2447-40aa-8f3c-310a40420344","resolution":{"observed_at":"2026-06-28T21:22:38.018502Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:23:20.048466+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:23:20.048466+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.683068Z","title":"Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual Speech Recognition Evaluation","venue":null,"work_id":"a725e4ec-3331-4b0a-ae53-2084079eb773","year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:4ff46001f1306f1cc2f3670f49ee821e8d9dd70e27ec61739eefc81ee4bc7827","observation_id":"028abfee-17f1-4f7a-9327-34837f28b584","resolution":{"observed_at":"2026-07-01T20:16:12.197182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Methodologies for the evaluation of speaker diariza- tion and automatic speech recognition in the presence of overlap- ping speech,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:de3d4e13ac3c10196fe43a3fc6adecd593f96123a4d5c15d5c61af02d7744d53","observation_id":"fd395b8f-7161-46be-a5c2-834210b4977c","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10083","last_updated":"2024-06-14T14:37:52Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T14:37:52Z","title":"On the Evaluation of Speech Foundation Models for Spoken Language Understanding","version":1},"cited_work":{"arxiv_id":"2406.10083","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10083","snapshot_observed_at":"2026-07-01T20:16:12.212461Z","title":"On the evaluation of speech foundation models for spoken language understanding,","venue":null,"work_id":"30f27d3d-d212-45f1-87be-f7889972acdc","year":2024},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2406.10083","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:495a474ffadfc0da501be87562ba27fdc6ccc9537c02ad5d5443b1ac6ee0cdd0","observation_id":"4a290e82-d760-457e-bb0a-9a35c539a185","resolution":{"observed_at":"2026-07-01T20:16:12.214339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Speechr: A benchmark for speech reasoning in large audio-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:af672a080c346d00da3bd76d7419df6d96d7e9c9a0dda3bc89ab35e1a94f76e0","observation_id":"1f03175d-1081-4afc-9402-c9ad969f983d","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02018","last_updated":"2025-08-04T03:28:04Z","snapshot_observed_at":"2026-08-06T05:16:43.051257Z","submitted_at":"2025-08-04T03:28:04Z","title":"SpeechR: A Benchmark for Speech Reasoning in Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2508.02018","doi":"10.48550/arxiv.2508.02018","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02018","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Speechr: A bench- mark for speech reasoning in large audio-language models","venue":"ArXiv.org","work_id":"07e95d1f-e816-42a3-a721-a000d55fe7ef","year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2508.02018","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:6aed40308423fc81db8df67005fd1a707334b4ee35f00568b2abd8ec35d903db","observation_id":"94866213-157c-48b7-ae26-64f2e45be034","resolution":{"observed_at":"2026-07-01T20:16:12.181582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"SUPERB: Speech Processing Universal PERformance Benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:5098e8d8127152d6007a08450e3b1123de048d979d2928a7e6c0ad53b3fb7ff6","observation_id":"5cd47468-86f6-4c71-95c6-d379a91c8e6b","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Dynamic-SUPERB: Towards a Dynamic, Collaborative, and Comprehensive Instruction-Tuning Benchmark for Speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:94c603ee9a17e255e5690e919c19c9531d5cde0e23d44c61b0ade652c599c6a7","observation_id":"64b9a5d4-a7a5-43a7-a8e7-24c7dd9b23bd","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:4848e807f7eaf247e5dd1af500fe7f509c5c9829c1bbca9084cdc0203519f7e1","observation_id":"dcbab749-a30d-4172-953e-aeee35d999ad","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"AudioBench: A Universal Benchmark for Audio Large Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:c46d8f4e57a7900a3c6169feb481d197930459302a8fd223aaa55df29df20eef","observation_id":"39901a07-00e3-4ca5-9b6d-7dbd6eee20d5","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:ae63705a470b940b65c4c519bd8df83c305f549dc7a056374b7fd30daaaa748d","observation_id":"26975453-eb90-4d85-87ab-71f476c7aee6","resolution":{"observed_at":"2026-07-01T20:16:12.193979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2410.19168","doi":"10.48550/arxiv.2410.19168","metadata_source":"pith","pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","venue":"eess.AS","work_id":"e60f85db-636c-4830-af85-5d31ebc74a1b","year":2024},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:6ec01333b6eab6e2489f2b0e097d71de7ee0c8bc354b193b393492c9cd15e367","observation_id":"3482c4a0-d002-48cb-9eff-b7b4591b78bd","resolution":{"observed_at":"2026-07-01T20:16:12.207674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-07T15:43:15.821319Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":"2505.13032","doi":"10.48550/arxiv.2505.13032","metadata_source":"pith","pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmar: A challenging benchmark for deep reasoning in speech, audio, music, and their mix","venue":"cs.SD","work_id":"fe97a573-dedf-4e07-af07-b22508260a10","year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:4dc87e194382e0eb42c568876672d5ebfe4125987af8d7480068875f1b8d54f9","observation_id":"69d7a8f7-47e5-4d33-b6c2-5d1e157bf6b8","resolution":{"observed_at":"2026-07-01T20:16:12.221545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11394","last_updated":"2024-01-25T19:48:36Z","snapshot_observed_at":"2026-08-06T21:49:56.814226Z","submitted_at":"2023-07-21T07:22:18Z","title":"MeetEval: A Toolkit for Computation of Word Error Rates for Meeting Transcription Systems","version":3},"cited_work":{"arxiv_id":"2307.11394","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11394","snapshot_observed_at":"2026-07-01T20:16:12.222896Z","title":"Meeteval: A toolkit for com- putation of word error rates for meeting transcription systems,","venue":null,"work_id":"19b9bb07-4391-44f1-adc1-7dfb8cf38984","year":2023},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2307.11394","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:70be81d4b7898fd158dc7fcfb5e7ed801da97bfa4340a7573e4c0942d1cd3059","observation_id":"7d969661-0ce0-4a91-b55e-2dd43ed37aee","resolution":{"observed_at":"2026-07-01T20:16:12.224798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"A call for clarity in reporting BLEU scores,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:daeb9496288a58bc088f0caaa99adbb72732deea6d6a6cd64222739a64f50cd6","observation_id":"296ec7f2-ae2d-4e9f-b3f5-8716a85cd31e","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:35be0b13bcbae4be1ff97fd20df99118d7d6cff30929f32d34e6508d926b0228","observation_id":"afe61cb0-722c-4aac-b777-01fe72d86fb1","resolution":{"observed_at":"2026-07-01T20:16:12.228406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23036","last_updated":"2025-05-29T03:22:59Z","snapshot_observed_at":"2026-08-07T12:52:52.710059Z","submitted_at":"2025-05-29T03:22:59Z","title":"AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition","version":1},"cited_work":{"arxiv_id":"2505.23036","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23036","snapshot_observed_at":"2026-07-01T20:16:12.215607Z","title":"Aishell-5: The first open-source in-car multi-channel multi-speaker speech dataset for automatic speech diarization and recognition","venue":null,"work_id":"508bf608-b0cb-41d1-94dd-70157758e196","year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2505.23036","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:d2875d3b3f1d82fa2d4aa7a3b36b593b6317862e6e7fca5bb7fba232d9593591","observation_id":"d3548ec0-aed3-4855-8934-4fd9c98a649c","resolution":{"observed_at":"2026-07-01T20:16:12.217425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"The AMI meeting corpus,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:ef24c4c1abfe24f1a582c7e5977c5985419f9a7ddeefd6a434b80fb00bcedd8f","observation_id":"9a936dab-ecb5-4359-aa0d-0dccd86b425e","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"M2MeT: The ICASSP 2022 multi-channel multi-party meeting transcription challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:deefe1e6b3db2dc5f04c24b9742a4c62442e58ec88116561243282913fe26a09","observation_id":"5d7c5471-3f32-4c18-b587-d5149b49e0d0","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18913","last_updated":"2025-03-12T03:06:01Z","snapshot_observed_at":"2026-08-07T17:47:52.792090Z","submitted_at":"2025-02-26T07:59:55Z","title":"CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition","version":2},"cited_work":{"arxiv_id":"2502.18913","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.18913","snapshot_observed_at":"2026-07-05T13:21:06.207360Z","title":"Cs-dialogue: A 104-hour dataset of spontaneous mandarin-english code-switching dialogues for speech recognition.arXiv preprint arXiv:2502.18913","venue":"cs.CL","work_id":"6627221c-a972-44eb-a92e-176f49387d4e","year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2502.18913","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:0c21af09f9d6a4472080015866f683b47f820b010caefdce702775a102a81537","observation_id":"c2a86ac6-f407-4206-9009-bfd1395d35d4","resolution":{"observed_at":"2026-07-01T20:16:12.204210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Ke- speech: An open source speech dataset of mandarin and its eight subdialects,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:d7bf8fd8db19f88018cd11bc1caf48aeda5e26fc4558842d46c639bcaa45190f","observation_id":"fb65c358-ef66-49dd-a175-f9c4b0ccb4b3","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05727","last_updated":"2025-08-06T07:10:17Z","snapshot_observed_at":"2026-08-06T19:16:52.526691Z","submitted_at":"2025-07-08T07:21:20Z","title":"ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark","version":2},"cited_work":{"arxiv_id":"2507.05727","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.05727","snapshot_observed_at":"2026-07-05T13:21:06.349448Z","title":"Contextasr-bench: A massive contextual speech recognition benchmark","venue":"eess.AS","work_id":"8c15e3d8-2138-44b7-9be8-ee4ce2dee17f","year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2507.05727","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:8de4628d3cc09c1b5fcd65eba694189cd8bea4c86556c6704ea177efe5456334","observation_id":"3274ed34-a22f-45c1-a99d-ea714381e61a","resolution":{"observed_at":"2026-07-01T20:16:12.204617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18184","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.819917Z","title":"VIBEVOICE-ASR technical report","venue":null,"work_id":"8c3744fb-dfff-4f53-8445-4806dbf5929a","year":2026},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:1fb289604abd5be9637ec1af80a6b855ea5476711a7b584d2b573e544a8f9376","observation_id":"5618bc1a-9b9d-4e38-b275-6a2830f16ad7","resolution":{"observed_at":"2026-07-01T20:16:12.211050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Covost 2 and massively multilingual speech translation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:2a6aefcc8369ccb97f724feb51a31e810f237924b21ea1e0c681b6d5156883eb","observation_id":"e8deb034-0f0e-4e2d-bff3-6c1b411910f6","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Swift: a scalable lightweight infras- tructure for fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:77e3488cd49d87aeba45e5cd1d961ab28f6e92e9b1daa3647419aed3bc022f1a","observation_id":"9612d6d9-0555-4344-8feb-fdd26c7c38bc","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:205c064f79c7e6cc28c7818585cbff1abf958b8ac83164af79bb148c90d51fcd","observation_id":"6909e9fc-10d9-4ccc-a492-32d8a4700f93","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Meld: A multimodal multi-party dataset for emo- tion recognition in conversations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:a500459818f07c5d97b3e4c3f7d781c9ea5db14dca00b5150df8481025c57d7d","observation_id":"65b865b1-96b6-4c76-af54-b2f3f79292eb","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Slurp: A spoken language understanding resource package,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:98afe0ed2b1efd5b49cfde41e699718add6f69ea523897721b64379ed270e55e","observation_id":"b0c5d0c6-97f4-42db-9485-0aa650900d87","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-02T22:58:18.776196Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":"2506.04779","doi":"10.48550/arxiv.2506.04779","metadata_source":"pith","pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","venue":"cs.CL","work_id":"1a24d3b1-2d00-407c-90f0-b0aeec13bfe6","year":2025},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:3e866712942908b38b6592d429430fd5e9caac7a0807b92628f41ad1cc001b45","observation_id":"962b0ebd-c620-4413-995a-90165ce58c4e","resolution":{"observed_at":"2026-07-01T20:16:12.184460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:888aeb1d72e252db891637b96e7fd3f827823a5028cf0907ae093a6c8f9cfd0d","observation_id":"d25732a5-3a4d-42a7-98a9-d0d5d9ac5554","resolution":{"observed_at":"2026-07-01T20:16:12.190584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T21:20:16.428207Z","title":"Tasu: Text-only alignment for speech understanding,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:f6d0d68a0bd13107dd60ee10df5ea51ac71bea35b80c3cc6a77dcddad92fbcf2","observation_id":"1ab4ecf5-88b8-478b-94ba-d2cf3e7171d9","resolution":{"observed_at":"2026-06-28T21:20:16.428207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.595884Z","title":"Available: https://arxiv.org/abs/2511.03310","venue":null,"work_id":"4d623d94-692b-4977-9e27-2eef00d1b6b8","year":null},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:bde4413b615fe439d6298d8c5065b5f9b3fd12d659d871f7ab7908394f9c5afa","observation_id":"e49f5dfa-6b1f-4d10-aa27-266b3af7f066","resolution":{"observed_at":"2026-07-01T20:16:12.187566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":23,"verified_exact":14,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2605.30899."}