{"as_of":"2026-08-09T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d7c1cfb92fac493a728ad96f7d2aff3cc848aaebe19383ee6a3a19d0b169898","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:49:21.783339Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:49:18.926273Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:49:22.026276Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"cited_work":{"arxiv_id":"2505.21578","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21578","snapshot_observed_at":"2026-08-07T13:49:22.026276Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","venue":"cs.CL","work_id":"c1edcb83-2bba-4b7a-a700-ab92e5e3f77d","year":2025},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:18.926273Z"},"links":{"cited_paper":"/paper/2505.21578","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:f105c5fa44c3ee8200d77503b5ad63d17e4bf3ac4137a368adb3e8c87d8b82b3","observation_id":"2232aa19-443b-418f-9e68-3cfda600b704","resolution":{"observed_at":"2026-08-07T13:49:22.160440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21578/citation-record","integrity":"/paper/2505.21578/integrity","json":"/paper/2505.21578/citation-record.json","paper":"/paper/2505.21578"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:24.241995Z","title":"open-source","venue":null,"work_id":"82a58939-bc6b-4214-9c18-d1012cf9a492","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:18.821110Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:a72efb4f4869ab6c9a036bcdcbfbdfda9cc56ec5f96c7c7e7d8f6c9d18b34c65","observation_id":"86228da0-13b9-456f-bba9-b3845192c19b","resolution":{"observed_at":"2026-08-07T13:49:24.394179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"cited_work":{"arxiv_id":"2505.21578","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21578","snapshot_observed_at":"2026-08-07T13:49:22.026276Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","venue":"cs.CL","work_id":"c1edcb83-2bba-4b7a-a700-ab92e5e3f77d","year":2025},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:18.926273Z"},"links":{"cited_paper":"/paper/2505.21578","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:f105c5fa44c3ee8200d77503b5ad63d17e4bf3ac4137a368adb3e8c87d8b82b3","observation_id":"2232aa19-443b-418f-9e68-3cfda600b704","resolution":{"observed_at":"2026-08-07T13:49:22.160440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.801580Z","title":"dev-other","venue":null,"work_id":"db11f889-0275-4f9f-9dd8-ff3323f5fa35","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.100288Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:e3d1ffb893e194ccd5930795de8206372f52190526622e006b162d6f45f9d9af","observation_id":"3cb75ae8-7806-45ed-8591-b197b1d11987","resolution":{"observed_at":"2026-08-07T13:49:23.889982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.685802Z","title":null,"venue":null,"work_id":"9fd5d03b-0fe2-4ba9-ac84-788209b695c2","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.188453Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:9293dd833ac2f07b2f6dfeebc3d60e6580c87e6504dbd87693231e84c45db18f","observation_id":"2f61fc9c-bdac-46c9-bef6-fb1aa54c9974","resolution":{"observed_at":"2026-08-07T13:49:23.743847Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.406243Z","title":"The dataset is easy to reproduce thanks to the SpeechBrain re- leased source code and can be loaded in a single line of code","venue":null,"work_id":"617e82fe-2a40-4816-b001-2a5d0c8d6e47","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.273591Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:0f8b74af5fb7c6993b51ac860e310ab52561e2ea645ef62407bd9f856824dc00","observation_id":"6921c4be-1ce9-4e8e-8e98-955461dd57aa","resolution":{"observed_at":"2026-08-07T13:49:23.596584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.874157Z","title":"Mosel: 950,000 hours of speech data for open-source speech foundation model train- ing on eu languages,","venue":null,"work_id":"e9886c1b-1d2c-4561-9a2e-4eda438490e9","year":2024},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.155009Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:b2af17318582efcb63baaf183cc07cf0374fd7cc61a5d7e80335c6afcfc39422","observation_id":"7bb05ae4-89c5-4403-a3fd-02391cb282d9","resolution":{"observed_at":"2026-08-07T13:49:22.936707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.219256Z","title":"The design for the wall street journal- based csr corpus,","venue":null,"work_id":"7b1ffd9f-c2ca-45c9-9019-57fa65084535","year":1992},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.415192Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:39880a028b0cd612e285103157236e0d9ea872431bd4b00917bf6e5f58e9b601","observation_id":"3c5899e0-7220-43a1-9edb-d87e6474afe9","resolution":{"observed_at":"2026-08-07T13:49:23.282469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.067870Z","title":"Darpa timit acoustic-phonetic continous speech corpus cd-rom. nist speech disc 1-1.1,","venue":null,"work_id":"8e37cb17-b7e0-4df2-bc60-31cf03ae068e","year":1993},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.540643Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:02299290ea7a0e949f591d769d3c96974895f30d0be38ac7176f8d4c603ca4bb","observation_id":"21e858af-ea56-477b-b161-b649dc65e523","resolution":{"observed_at":"2026-08-07T13:49:23.109696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:19.722000Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.722000Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:b5941458e8b445c944992f08bc3b8cf7c9ea2c1135f4074df710a44cfb8ed2c0","observation_id":"2833979d-5341-4859-b931-91574bd846d9","resolution":{"observed_at":"2026-08-07T13:49:19.722000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:19.868605Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.868605Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:4d7a8b7fab7d4de73259a51524f8af68de7895a704166456636732b37dc93b21","observation_id":"e3b28d05-9402-41ee-a114-f234b230419b","resolution":{"observed_at":"2026-08-07T13:49:19.868605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07341","last_updated":"2024-04-12T18:23:35Z","snapshot_observed_at":"2026-08-02T08:45:14.352805Z","submitted_at":"2024-04-10T20:40:24Z","title":"Conformer-1: Robust ASR via Large-Scale Semisupervised Bootstrapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07341","snapshot_observed_at":"2026-08-07T13:49:20.016438Z","title":"Conformer-1: Robust asr via large-scale semisupervised boot- strapping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.016438Z"},"links":{"cited_paper":"/paper/2404.07341","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:4940eec437ab38480bf447c2d2bf4fd9aca2b0b52f9697acc83613889d3dd465","observation_id":"27e30a3f-6914-4aef-b1de-f9656e08d8ce","resolution":{"observed_at":"2026-08-07T13:49:20.016438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T13:49:21.093321Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.093321Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:a1e9f2380a3e2bb7ade613871b42e1354fb52407bfe35c460d50eb8d02e6a77c","observation_id":"48f8d9f6-776d-4b89-85bd-820eb4c85620","resolution":{"observed_at":"2026-08-07T13:49:21.093321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:20.351770Z","title":"Yodas: Youtube-oriented dataset for audio and speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.351770Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:4c6b6f9b562231e18d25a797a79e969459aa4f6959a594b8fa95d05b16876db1","observation_id":"06f76e27-7e8b-4b08-bc88-fe1b898c0c92","resolution":{"observed_at":"2026-08-07T13:49:20.351770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.735504Z","title":"Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,","venue":null,"work_id":"a9c5b6d2-4b4e-418a-bcea-2ef621460952","year":2024},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.544196Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:45a1848eddf9771bf57adb4d1a9ed1ba5506975baf4c40ffcd826b57768faa18","observation_id":"f10eea87-3652-4171-bb8e-2ae55c4a4af5","resolution":{"observed_at":"2026-08-07T13:49:22.780955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:23.968480Z","title":"People’s Speech [9] and YODAS [7] are the most recent attempts at overcoming the read versus spontaneous speech issue at large scale","venue":null,"work_id":"f1fa4e6e-46a6-4f43-8104-c73c3ce928c3","year":null},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:19.029598Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:a0b94453094c75eb4a07435ac419c56fc26a891cd986ec953ae3bb2f9a90b89c","observation_id":"287cf320-8e23-46a3-8c7c-cad2c419ef2f","resolution":{"observed_at":"2026-08-07T13:49:24.045529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T13:49:20.652179Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.652179Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:3161c9f01a3fe0db42f9785f6fefbd4bf4d31757ccf68c58d2507a9a852e8ad8","observation_id":"d94107cd-9278-4f9c-abfd-72870ccb72d7","resolution":{"observed_at":"2026-08-07T13:49:20.652179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02133","last_updated":"2021-04-27T13:23:27Z","snapshot_observed_at":"2026-08-09T12:00:34.585038Z","submitted_at":"2021-04-05T20:13:36Z","title":"SpeechStew: Simply Mix All Available Speech Recognition Data to Train One Large Neural Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02133","snapshot_observed_at":"2026-08-07T13:49:20.806789Z","title":"Speechstew: Simply mix all available speech recognition data to train one large neural network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.806789Z"},"links":{"cited_paper":"/paper/2104.02133","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:dfc7369268cb8f9b4728850d5966588a75e2f6257c0064c33e0e7d6f77e34a96","observation_id":"fc3ba030-0bf9-4472-86b6-df1c827b9927","resolution":{"observed_at":"2026-08-07T13:49:20.806789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:20.960789Z","title":"Reproducing whisper-style training using an open-source toolkit and publicly available data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:20.960789Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:1c8644e30d6e460f576236dd36b289091a9e38420558791f0cd5963dd907e369","observation_id":"4794e4e2-7e1b-4afe-96ca-bf96996520d8","resolution":{"observed_at":"2026-08-07T13:49:20.960789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T13:49:21.198546Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.198546Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:9027def6d4a532e851e7e479657f0d39e1437d8cb70c428c0a2e67bdad2bf633","observation_id":"9dc565a7-c1be-46a6-9342-50d71a9f83fe","resolution":{"observed_at":"2026-08-07T13:49:21.198546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.549995Z","title":"Open-source conversational ai with speechbrain 1.0,","venue":null,"work_id":"d204f733-c94c-4a66-b65f-a30c1565fd4e","year":2024},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.352107Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:9d2e0cd0d544e823fea24aaac0d1b34435d1b5373e1bd8e08067df5bb410f9f9","observation_id":"39e6ca45-5e08-4ef6-acb3-1f1219484f0a","resolution":{"observed_at":"2026-08-07T13:49:22.623249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T13:49:21.471158Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.471158Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:d9d2cc3831915a139744454b19ec10299f95131b3f499e37311a1ce1958e0d7e","observation_id":"80bb602e-4d01-4b5d-82c3-8a56169d6738","resolution":{"observed_at":"2026-08-07T13:49:21.471158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.390428Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":"9800ca8a-cb51-40fa-a295-15cc1f4fbd88","year":2021},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.645978Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:53610c3db7de95a0599156b3fd4e5ebdffa9513f45c72740d1fe3d9db5b94328","observation_id":"44b33b1d-a72a-4c23-94b9-0f3acd44b9ea","resolution":{"observed_at":"2026-08-07T13:49:22.464684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:22.266811Z","title":"Joint ctc-attention based end-to-end speech recognition using multi-task learning,","venue":null,"work_id":"f2a494b9-34df-4675-8632-131c4378e70a","year":2017},"citing_paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:21.783339Z"},"links":{"citing_paper":"/paper/2505.21578"},"observation_digest":"sha256:a8e77f174ef88c2b6581ce5e0b241cac8fbf08efb53dd346c5880978057b7af0","observation_id":"a99041cf-c46f-4689-bd42-82de3fd80fbb","resolution":{"observed_at":"2026-08-07T13:49:22.319240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21578","last_updated":"2025-05-27T08:40:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:42:21.112209Z","submitted_at":"2025-05-27T08:40:28Z","title":"Loquacious Set: 25,000 Hours of Transcribed and Diverse English Speech Recognition Data for Research and Commercial Use"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2505.21578."}