{"as_of":"2026-08-22T01:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:759409b77569bcb8950d8f0486f2b94ab452c595fc7883b3220d75c086c6d655","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:16:31.419659Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:16:31.102623Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T17:16:31.542417Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"cited_work":{"arxiv_id":"2508.16576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.16576","snapshot_observed_at":"2026-08-05T17:16:31.542417Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","venue":"cs.LG","work_id":"5b1242f5-2244-4c07-a5a8-c7555949a3d5","year":2025},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.102623Z"},"links":{"cited_paper":"/paper/2508.16576","citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:1be9b40edb231e4faae8f5ace0c68232c55ed3acd10eaea36575e4db849bb6ae","observation_id":"2eafadc7-12b5-49dc-bbec-8791a94cbc41","resolution":{"observed_at":"2026-08-05T17:16:31.551433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16576","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Benchmarking training paradigms, dataset composition, and model scaling for child asr in espnet,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2508.16576","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:10e766d2869d3b93a47b663fce3c420302ba604b634ca1c2d3cdda09ce2895e4","observation_id":"cf1645f8-3434-461a-8948-80afd9fc8bd5","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.16576/citation-record","integrity":"/paper/2508.16576/integrity","json":"/paper/2508.16576/citation-record.json","paper":"/paper/2508.16576"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"cited_work":{"arxiv_id":"2508.16576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.16576","snapshot_observed_at":"2026-08-05T17:16:31.542417Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","venue":"cs.LG","work_id":"5b1242f5-2244-4c07-a5a8-c7555949a3d5","year":2025},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.102623Z"},"links":{"cited_paper":"/paper/2508.16576","citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:1be9b40edb231e4faae8f5ace0c68232c55ed3acd10eaea36575e4db849bb6ae","observation_id":"2eafadc7-12b5-49dc-bbec-8791a94cbc41","resolution":{"observed_at":"2026-08-05T17:16:31.551433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.587379Z","title":"fine-tuning), front-end representations, representation types (continuous vs","venue":null,"work_id":"050bfcfc-fb7f-41a3-8c64-5df6d9f23b5b","year":2048},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.108835Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:f3ab31a9491197979a82d92e1ace8389f35feb46fecc76b866d3fc270f40da75","observation_id":"74fa6b2a-e06d-405b-88c5-1978a31ba304","resolution":{"observed_at":"2026-08-05T17:16:32.594125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.562704Z","title":"Child speech corpora The experiments are conducted on three child speech corpora summarized in Table 1","venue":null,"work_id":"879b3f01-4a4d-47ac-8b61-553e4fd02784","year":null},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.115680Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:a8c6ff535ddfbe5c62a592ed0e3388609ccc354dbe92a96a33fa4d4defd7796c","observation_id":"0994f503-58d8-4df7-a075-5efcf7235c8a","resolution":{"observed_at":"2026-08-05T17:16:32.571858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.536840Z","title":"Flat-start training vs","venue":null,"work_id":"0be37587-ec8f-46a9-ba8c-ed604cf6ec66","year":2000},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.121205Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:945a9cf4527ae622f981010f2fb4d56ab5d02629c83d5cd4897d215874330549","observation_id":"6445c31f-81b7-4e2a-8b84-eeb5c398b3ae","resolution":{"observed_at":"2026-08-05T17:16:32.543442Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.509641Z","title":"While fine-tuned models generally perform best, flat-start models help mitigate biases in SSL representations, which are predominantly trained on adult speech","venue":null,"work_id":"01f9c486-7691-4781-adb7-6b3aa6343f55","year":null},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.127321Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:e65bbc282c869196111e983f86d0adb5376f94480d1ac1814bf7383790db3fdf","observation_id":"472239de-2e27-4c49-913c-fd43565cd75c","resolution":{"observed_at":"2026-08-05T17:16:32.517526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.478330Z","title":"Additional support was provided by FWO-SBO grant S004923N: NEFL, KU Leuven C24M/22/025, and FWO grant V401325N","venue":null,"work_id":"efc6c2d7-8789-4286-a59c-ea473cfef994","year":null},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.132633Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:c0f1e5602672cd89ccaee08c3c97d60a6748ecc07d9d774c09ba45d5fdd875b3","observation_id":"5dfb216a-0a63-428b-a632-db515e58a32a","resolution":{"observed_at":"2026-08-05T17:16:32.487710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.138386Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.138386Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:815abccce691daf24ab8bab74a06f861ff7cdf2041d40338d8381b231a94cbac","observation_id":"3ca39a5d-ac42-416b-bfb5-6d082c70b7a1","resolution":{"observed_at":"2026-08-05T17:16:31.138386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.426378Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"50261b22-cc95-455b-ba40-5b478b41e819","year":2021},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.143121Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:9c4eaa376db41a45e4c6cc58f5e3d5f3083a4241c00a5cf3460da4339b8bdc12","observation_id":"1c608275-75bb-4a9b-b0da-6fd801d3376b","resolution":{"observed_at":"2026-08-05T17:16:32.434279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.396041Z","title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"3c7d145c-0538-4b02-9c7c-5455d2d48e89","year":2020},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.148533Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:c76709bbca86fa990d94e14804da8b47fa67c857d9a8ed3448e9e7a552d1c70f","observation_id":"20aec226-25a8-42af-8994-e4e19a5732d3","resolution":{"observed_at":"2026-08-05T17:16:32.405360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.362310Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"1907e083-a091-499d-b50f-4226f7fad0aa","year":2023},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.154323Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:1036cb4c2b34367fdcfb6c531b6c6f4286543403a0ced8f220824c8622a4b8bb","observation_id":"df379917-991e-4840-9d00-441e59491b8a","resolution":{"observed_at":"2026-08-05T17:16:32.368367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.336582Z","title":"Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,","venue":null,"work_id":"4f784cee-d157-4d60-ae04-2749294baa15","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.160946Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:fafd18ff2530d40440891abd59d7275c3a90391c13b59b1241530939b6ccd72a","observation_id":"fad0f4ce-27fe-4651-be4f-58991921b337","resolution":{"observed_at":"2026-08-05T17:16:32.347480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.314568Z","title":"Less is more: Accurate speech recognition & translation without web-scale data,","venue":null,"work_id":"d1962f8b-9a02-4dd1-8e6f-ca55c8cdbc89","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.167905Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:e78fdf355911688421482e944773150240fee759d54288298ad7ddde29205635","observation_id":"fd70485c-8065-4542-b9d2-7cde717a2f52","resolution":{"observed_at":"2026-08-05T17:16:32.320551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.296768Z","title":"Acoustics of children’s speech: Developmental changes of temporal and spectral parameters,","venue":null,"work_id":"7c908cb9-6d29-4801-b537-7f3fd859f232","year":1999},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.174142Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:47fc53b0722174235ada0378bb8a29e0a4fd499059968fb35d51fa79681317e6","observation_id":"55526a59-4dda-47a1-b8a1-b5289fe3fc4e","resolution":{"observed_at":"2026-08-05T17:16:32.302029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.276230Z","title":"On the difficulties of automatic speech recognition for kindergarten-aged children,","venue":null,"work_id":"d43b924d-8fe0-43fd-ba51-1c526bfd7df9","year":2018},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.182289Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:677696033d2023014c6145cf3f4b0053d899a34c4dd5c64d891694b52340d98f","observation_id":"2cba373b-c6f9-41d9-a4f4-66bdc9a0b23e","resolution":{"observed_at":"2026-08-05T17:16:32.282771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.256677Z","title":"Challenges remain in building ASR for sponta- neous preschool children speech in naturalistic educational envi- ronments,","venue":null,"work_id":"f885d327-fa4e-4219-afbf-b904b0cd1c5b","year":2022},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.190094Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:4d6098e80dbad5131e19ce064c99dd9d2f9e95f2f948af810c0c0fe8c9e3079c","observation_id":"721ca13b-b691-4858-bcae-c30ae3bae5dc","resolution":{"observed_at":"2026-08-05T17:16:32.262963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.236257Z","title":"V ocal tract length perturbation (vtlp) improves speech recognition,","venue":null,"work_id":"fb978567-5999-4b35-bcbe-c4f358f33c08","year":2013},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.196402Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:990ed34d9e4e526f4531df128a67b3f25e31d482a09707e427e7fb3225284e8d","observation_id":"9b42ae76-4c44-480f-9976-8758c7177332","resolution":{"observed_at":"2026-08-05T17:16:32.241891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.217681Z","title":"Prosodic adaptations to pitch perturbation in run- ning speech,","venue":null,"work_id":"42ec4698-fb3c-4cc0-86a5-ba08357f1b56","year":2011},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.206230Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:e9f99e223e74992eb9b01631b1292e8f80c0c2dc4e421e55d346a078168fb219","observation_id":"c17c774b-058e-4795-aabb-e42dd1a2eee0","resolution":{"observed_at":"2026-08-05T17:16:32.223689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.192669Z","title":"V oice Conversion Based Data Aug- mentation to Improve Children’s Speech Recognition in Limited Data Scenario,","venue":null,"work_id":"578d4753-b3d3-40bb-b7fb-82780b723460","year":2020},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.213002Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:ff906a97ee84ef943c1fb6ae7139f490626e930c9e0e7751908b96ebe30b5a76","observation_id":"6ad89029-9f22-40f4-a7a9-f5face5f7dee","resolution":{"observed_at":"2026-08-05T17:16:32.199171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.169855Z","title":"Improved children’s automatic speech recognition combining adapters and synthetic data augmentation,","venue":null,"work_id":"e3baebf5-d46d-4e03-a4d8-5c441f03f541","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.217767Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:10f53b6fd0eccc0ac878b28692576213dba18345bd7627f65d057ad9bf6c6b1e","observation_id":"d5cdc2ba-57ac-4600-b839-6d8372153ad2","resolution":{"observed_at":"2026-08-05T17:16:32.176800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.144364Z","title":"Transfer learning from adult to children for speech recognition: Evaluation, analysis and recommendations,","venue":null,"work_id":"916af8d1-7129-4c4b-b3c2-1b313581dad7","year":2020},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.222384Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:d688852968fe4c93f43394c839ce88894e9c7ff499e7f90df275f640c6bd10c8","observation_id":"7d53c064-1cad-4b49-aa08-d4c1440aa027","resolution":{"observed_at":"2026-08-05T17:16:32.150832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.123504Z","title":"Benchmarking children’s asr with supervised and self-supervised speech foundation models,","venue":null,"work_id":"e77c5f48-aefd-4372-83a3-115cd52d0d73","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.227688Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:33ec0a0e4aa23ba78297382333d47a5f1472147f35a6c48b6ac1783e55aa6e7a","observation_id":"594556bd-3869-4098-9d78-6f4021ce2dc6","resolution":{"observed_at":"2026-08-05T17:16:32.129392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.098921Z","title":"Kid-whisper: Towards bridging the per- formance gap in automatic speech recognition for children vs. adults,","venue":null,"work_id":"3b764023-be8f-4b12-8488-aa7db5a8a19d","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.233899Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:bfd0ec55b25c9fc28ecf9eb8a95a089a77db104cb2755ff5e1872217d0aff2d5","observation_id":"494033fe-5ea3-4c63-8eed-37988ad64a49","resolution":{"observed_at":"2026-08-05T17:16:32.105117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.077058Z","title":"Ml-superb 2.0: Benchmarking multilingual speech models across modeling constraints, languages, and datasets,","venue":null,"work_id":"bed5f379-7335-415c-a1e8-92b84a27845b","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.238912Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:4ff4b1dd48572b0a6833279a5c26b62240e1a19754578af2b407f3300754fa73","observation_id":"1cca7780-710b-4d60-8ce2-f568aaeffc6c","resolution":{"observed_at":"2026-08-05T17:16:32.085269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.055820Z","title":"On the evaluation of speech foundation models for spoken language understanding,","venue":null,"work_id":"05809f4f-d0ee-4479-91d9-b26c120e16b5","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.243601Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:25ecf293fba5cba5f0a3b59a2924c283326dc718bc87da0ab7685a059c249221","observation_id":"3dbe124c-4e8c-42d6-89e8-63a6dad6700f","resolution":{"observed_at":"2026-08-05T17:16:32.062965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.037311Z","title":"Speech self-supervised representations bench- marking: a case for larger probing heads,","venue":null,"work_id":"1ee01922-50de-40cc-94ed-c2e069df1c19","year":2025},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.250018Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:d9fdb9c1a9d88d915aeb1acbfc08bc7d2960fd79630964b22819664d265f6550","observation_id":"773600a9-fd3d-4dbc-b007-063dc4c5e629","resolution":{"observed_at":"2026-08-05T17:16:32.043459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:32.007526Z","title":"Analysis of self-supervised speech models on chil- dren’s speech and infant vocalizations,","venue":null,"work_id":"d155fb0f-b8b3-435a-95fe-5be1286704ea","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.258012Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:72370c980193506ac0286afc45d0208cabe9c51714c05b300d9ee0258d34cf3a","observation_id":"2773c104-cbbb-4c8e-9750-de3cafca9114","resolution":{"observed_at":"2026-08-05T17:16:32.018584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.984254Z","title":"Towards better domain adaptation for self- supervised models: A case study of child asr,","venue":null,"work_id":"016277bf-9700-4650-9390-024b6426109e","year":2022},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.263848Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:1fe83520498219d380c62c5e0da2c8c161ba83441052c40b6b6e05e726d4772d","observation_id":"71112622-77f6-48da-ab32-6ecdba487a96","resolution":{"observed_at":"2026-08-05T17:16:31.990930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.962771Z","title":"Towards universal speech discrete tokens: A case study for ASR and TTS,","venue":null,"work_id":"b2414879-ea44-4d84-9670-a08b36e2a70c","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.270445Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:a8c41c1af2f72260030a9279e663db09c07c92a204165b9a39e498baa9b02856","observation_id":"babb52d0-be38-4d49-9bd7-1f6dd553f87b","resolution":{"observed_at":"2026-08-05T17:16:31.968788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.939029Z","title":"Exploration of efficient end-to-end ASR using discretized input from self-supervised learning,","venue":null,"work_id":"6553a6fa-0ffa-4e23-9122-8488a65549a2","year":2023},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.276584Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:7bfe0ba408ae100c242dbc765f55c4732da240e958df511da91541dda3618d36","observation_id":"b2ef6f22-7db0-4e07-be71-8765b62ee2b2","resolution":{"observed_at":"2026-08-05T17:16:31.946700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.917956Z","title":"A wav2vec2-based experimental study on self- supervised learning methods to improve child speech recogni- tion,","venue":null,"work_id":"5b6810ff-f9d1-46ef-a282-4304e861773a","year":2023},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.282942Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:adfb8d1f7f0f28d04cee50652854bcfb29f0fd7dbdc189140e93771eadac39ec","observation_id":"59c68ade-296d-41f4-b6f5-d309c9953c2a","resolution":{"observed_at":"2026-08-05T17:16:31.924405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.888800Z","title":"Children’s speaker verification in low and zero resource conditions,","venue":null,"work_id":"94f4da6a-41b3-4c16-afbc-190f94b9b476","year":2021},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.292512Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:82bf71c962842ba5c843bae9db110c9d1b38c35297bc1c2246d8bd9b9f0a8701","observation_id":"814d4849-537e-4311-b9f5-ad33a6eda4a0","resolution":{"observed_at":"2026-08-05T17:16:31.904823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.868480Z","title":"Childaugment: Data augmentation methods for zero-resource children’s speaker verification,","venue":null,"work_id":"a40db31f-b1bc-4c73-9f70-9001e2f4a472","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.299807Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:b295e1512168f7bcd54680ae1f282e655d69c0f34b37f4e13c0aac85f2c0b5c7","observation_id":"9afe58e0-cc83-44d8-97f7-1f37964f22d5","resolution":{"observed_at":"2026-08-05T17:16:31.874804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.847426Z","title":"Effective preservation of higher-frequency contents in the context of short utterance based children’s speaker verification system,","venue":null,"work_id":"1d98a159-ca18-4528-ac14-ac7058bce00d","year":2023},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.309249Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:4a4599002237a82466d6b48ac1d21c7c17406d6bc2595c4003d27656f4b4bb9e","observation_id":"d68023b3-f0d8-4629-a5f3-126e7027ff36","resolution":{"observed_at":"2026-08-05T17:16:31.853967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10373","last_updated":"2025-02-14T18:51:40Z","snapshot_observed_at":"2026-08-14T19:33:12.609183Z","submitted_at":"2025-02-14T18:51:40Z","title":"OWLS: Scaling Laws for Multilingual Speech Recognition and Translation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10373","snapshot_observed_at":"2026-08-05T17:16:31.314733Z","title":"Owls: Scaling laws for multilingual speech recognition and translation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.314733Z"},"links":{"cited_paper":"/paper/2502.10373","citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:af3716fe763366c78c1e6e12c971c3356466834c44bfe49f7b08d6891dee875c","observation_id":"cc235edc-9c73-4c81-b207-3b67131c1576","resolution":{"observed_at":"2026-08-05T17:16:31.314733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.826257Z","title":"Espnet: End-to-end speech processing toolkit,","venue":null,"work_id":"755af3d7-c3ff-4801-bfe3-8dc9eaeb0841","year":2018},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.320366Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:a9d35afb81f3c34a60a23b104affb03e27f1206c456037c4a5afc9d033cf1f4b","observation_id":"e468ad48-0e82-4cb5-af13-8ef59eae4165","resolution":{"observed_at":"2026-08-05T17:16:31.830861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.807499Z","title":"Reproducing whisper-style training using an open- source toolkit and publicly available data,","venue":null,"work_id":"47553d24-750d-4bf2-b29f-7c893ac67608","year":2023},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.325641Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:570450108bfa810775942c2c5ae358751cfe75b5ae593d51d3eece508f25d229","observation_id":"038c33fa-bf1b-4ecc-a9c3-8b8dd4df821d","resolution":{"observed_at":"2026-08-05T17:16:31.814241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.788650Z","title":"Towards robust speech representation learning for thousands of languages,","venue":null,"work_id":"48d77f2d-4aeb-45ca-956d-fe1f3668772f","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.332728Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:4e5f418f8bd6e5708d829bc246cdca62b6c4f2401e230f0ccdbf0d80e5ff5e79","observation_id":"f3a2d75d-323b-4ece-b301-ee4ddc39c05e","resolution":{"observed_at":"2026-08-05T17:16:31.794888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.763962Z","title":"E-branchformer: Branchformer with enhanced merging for speech recognition,","venue":null,"work_id":"d2ece027-9fbc-4765-abfe-5c34714cb7cc","year":2023},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.339183Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:7958b6327e23c779116daf4f4891fab157e463ade3597581f453c7482c6194d7","observation_id":"fdd13e0a-4fac-41f3-9289-22fe6f801df7","resolution":{"observed_at":"2026-08-05T17:16:31.770338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.744849Z","title":"A comparative study on transformer vs rnn in speech applications,","venue":null,"work_id":"0f441dd4-94f8-4209-88dd-d5b768c4dff8","year":2019},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.343888Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:14add744f0a02eb2068942b92d0127e88a2b5ec74bdcb373ce815cbcb8e4ddb8","observation_id":"fef85494-3100-4877-bc37-33968fc7e3c4","resolution":{"observed_at":"2026-08-05T17:16:31.751586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-15T00:39:21.296689Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-05T17:16:31.352621Z","title":"Sequence transduction with recurrent neural net- works,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.352621Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:def071b94e12f42f087551898d4deb70045c7e3afca1ecbddd5b698100eb5627","observation_id":"f4f9e820-4f9d-41b2-bcd4-c69025630516","resolution":{"observed_at":"2026-08-05T17:16:31.352621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.720801Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"42ba392c-5f2d-4df7-9fca-6dc69c7f3a65","year":2006},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.360651Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:85dd777df15aa42df998bda8a794d591d900842c31334413577d9acb0b80a480","observation_id":"a504f094-8293-4cc0-9994-55f1f8bdb81f","resolution":{"observed_at":"2026-08-05T17:16:31.729544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.700289Z","title":"OWSM-CTC: An open encoder-only speech foun- dation model for speech recognition, translation, and language identification,","venue":null,"work_id":"24d3b1c0-d83c-44c2-b290-c868b004f725","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.368276Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:5bf18600dc7b5a1b5ab41bdb7ee8e297a3dcc316db916ff2f7631d2bd801b312","observation_id":"2a22ccac-1f5b-4b56-9a34-a33a7698790c","resolution":{"observed_at":"2026-08-05T17:16:31.706898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.682003Z","title":"Pushing the limits of raw waveform speaker recognition,","venue":null,"work_id":"060f4e19-da06-4bf9-ab3a-486d5cf59f7f","year":2022},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.378744Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:96eff0cbda4186667592bac74ba86f7fe0e83dfb4f750324eae1ed0443c82189","observation_id":"c7b93c42-67f5-47c6-9344-4757ecb539f5","resolution":{"observed_at":"2026-08-05T17:16:31.687511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.659189Z","title":"Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,","venue":null,"work_id":"88bcadf4-d92b-4bd8-9b99-61e3430854c1","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.388748Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:f1d2f59f6cdf0e92f8ee01b505a79391c248c5c929c78018fb237afb76b627a1","observation_id":"b7adcdf7-cbfd-48eb-9ea0-cf29b959cac9","resolution":{"observed_at":"2026-08-05T17:16:31.666598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.638953Z","title":"My science tutor (MyST)–a large corpus of children‘s conversational speech,","venue":null,"work_id":"db88ee2e-1f38-4b66-a96e-4deedd2bf295","year":2024},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.394808Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:b5fdf5394219f75b6632e71390e7d714f3d8503ad33eb8ea6d31e0ae1538fc75","observation_id":"6a918204-7ae3-4e31-8952-583a8af7f7de","resolution":{"observed_at":"2026-08-05T17:16:31.644503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.618670Z","title":"The ogi kids’ speech corpus and recognizers,","venue":null,"work_id":"ff1243f1-513b-482a-9ad3-6dbd107dc8bb","year":2000},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.401161Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:e52ce052dadeb99ce65861db28efea8613d878ee49f3bea06148839973a0b997","observation_id":"7e1175c4-7c7b-4688-ab3e-64f4d69acd9a","resolution":{"observed_at":"2026-08-05T17:16:31.625739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.599121Z","title":"The cmu kids corpus,","venue":null,"work_id":"a9176eb4-f33e-44c2-b087-0a75199c6ddd","year":1997},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.410934Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:2ddfc92b1684b9eb0b4869ecccc9581395c52ee9b14b21849da57e8d665ea077","observation_id":"ad1048c3-6eca-4cb5-80ea-0d2c0ed7bdc3","resolution":{"observed_at":"2026-08-05T17:16:31.605906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:16:31.576483Z","title":"Superb: Speech processing universal perfor- mance benchmark,","venue":null,"work_id":"1a356b25-688c-4377-a962-884fe842c412","year":2021},"citing_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:16:31.419659Z"},"links":{"citing_paper":"/paper/2508.16576"},"observation_digest":"sha256:0d0bf95df05220625f52903a346c3b337ae5808bc7cbe19267acb2e5f5804905","observation_id":"ccb227d1-072e-48b1-97f8-8f76f5dd4358","resolution":{"observed_at":"2026-08-05T17:16:31.582622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T08:40:20.173882Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":1,"verified_fuzzy":43},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2508.16576."}