{"as_of":"2026-08-09T06:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf5d4aa686cb6e0a8109961d1a2afcb623f8db2f59aaa0d0c1113ff3a57aa5ab","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T00:48:21.716770Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03670/citation-record","integrity":"/paper/2607.03670/integrity","json":"/paper/2607.03670/citation-record.json","paper":"/paper/2607.03670"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10507","last_updated":"2024-06-15T05:13:19Z","snapshot_observed_at":"2026-07-06T18:31:21.929350Z","submitted_at":"2024-06-15T05:13:19Z","title":"Benchmarking Children's ASR with Supervised and Self-supervised Speech Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10507","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Benchmarking children’s asr with supervised and self-supervised speech foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2406.10507","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:d790349863d315b3dfb10dd10e5bf786c167a0e96662fde37b2a64c72ad1547a","observation_id":"a1e83528-89fe-4745-8984-5e6ce944bd51","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Automatic speech recognition (asr) systems for children: A systematic literature review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:a2b31fe9d4373d46be1baa728fbaf5ec78010dec33f9a53ce4681d9dfbaba33a","observation_id":"d9781e07-0864-4166-86d4-8601eed7fc10","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Qwen3-asr technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:b73834d2ece278fa946ebc0c47db98594b30369bfbbc9d7272d7caa05617cd56","observation_id":"5076ea0f-7273-4e39-aac2-8cd05796920b","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Canary-1b-v2 & parakeet-tdt- 0.6b-v3: Efficient and high-performance models for multilingual asr and ast,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:8a922610af6451499b9376d39c083f9f1e6fca9443d06c3ece840632c87ba2c0","observation_id":"21c98df7-0684-4e0a-8545-284b905b3fb4","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:ecea6871869688847e47af0b1f9a65625226c5d2c276375716c3de262738ba8f","observation_id":"43383fbd-3be8-4038-890a-e661e56457e8","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Exploring the effect of differences in the acoustic correlates of adults’ and children’s speech in the context of automatic speech recognition,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:cd6f6509211c84e6a884e8257b3013e10044f243c102757bf46f360ebfd4ce74","observation_id":"fb4483b9-0404-4f43-9ee8-1a86a9349e0d","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"A review of asr technologies for children’s speech,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:9d95bcd98f74031b3b398188f6c68bc64f62bc9790e3813ed851fd938e068681","observation_id":"e8f9cecb-fad6-496a-9f97-107ca88d23a2","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Transfer learning from adult to chil- dren for speech recognition: Evaluation, analysis and recommendations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:90c928a08d524e2fef3aa74832675ac67fe825c3d64f01cfd79d05f22653af3e","observation_id":"245cebf8-4e02-494f-aa1c-8762313b6bfd","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Speech production variability in fricatives of children and adults: Results of functional data analysis,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:14095f59363777a392bdbe6ff220db3c6de7e3d9b5cd80a18fe250806c15018c","observation_id":"1dd294de-32de-4ae9-8a6b-ad91b48786b3","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Stop consonant voicing and intraoral pressure contours in women and children,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:0172add5875bff9a9316bdd0d06c5156528bbc7ebc70f096c9dd61d0914ece00","observation_id":"b6626d5b-7de1-4307-a50e-80fdc0395a20","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Analysis of children’s speech: Duration, pitch and formants,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:5b345ec98d6edd420af7a3969b9fefa7eb273fa103798a1fb3686f4763488e11","observation_id":"bc952c76-0c54-4a3d-83b8-615e0989b7ae","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Acoustics of children’s speech: Developmental changes of tem- poral and spectral parameters,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:8df3bbf85f6a7e6460057e8dba0b67cc3c460c60a169255e06dde8db67398087","observation_id":"6697e24d-39ee-4a51-90ac-3de8bc392b4a","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"V owel acoustic space development in children: A synthesis of acoustic and anatomic data,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:0fc0dfcfa9b1be5d06e67ba802b9b1723db2e950f0dfa83ebcf3a0707728f765","observation_id":"d3d5cd9a-f03f-4cef-bbd5-4bc01002ae63","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Ticl: Text- embedding knn for speech in-context learning unlocks speech recogni- tion abilities of large multimodal models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:c96b90fdd3e37545f93ca9b3e8937c639a5344d32b000ac6312d6adc9ba9b969","observation_id":"c837983b-1073-44e2-be36-b5ad47ff419c","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Ticl+: A case study on speech in-context learning for children’s speech recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:cd697b95cdb75402a16eb75cc0a9c2efe1ef4ed203e000443cb7866a34981b9c","observation_id":"757425fc-85d3-4761-b5b5-3bfacae61d5c","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18904","last_updated":"2026-05-26T01:38:12Z","snapshot_observed_at":"2026-08-03T07:55:57.062877Z","submitted_at":"2026-01-26T19:15:16Z","title":"MetaSICL: Adapting Audiroty LLM via Meta Speech In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18904","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Sicl-at: An- other way to adapt auditory llm to low-resource task,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2601.18904","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:370b469d773cc80e95334b2439fd6d6aaf23c8a4e7178a40139dee60648723e2","observation_id":"6ca85725-1e1f-4b5c-9fc7-3a6a155b0768","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02615","last_updated":"2026-05-26T15:36:07Z","snapshot_observed_at":"2026-08-08T16:26:36.305631Z","submitted_at":"2026-05-26T15:36:07Z","title":"FSA-GRPO: Teaching Auditory LLMs to Use Few-shot Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02615","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Fsa- grpo: Teaching auditory llms to use few-shot demonstrations,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2606.02615","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:0a564d7744ab47aa03a20f9fa46f2e548be48fdd5d0f131ad440fc3ce715f37a","observation_id":"64788853-d44f-4683-9f8e-9a7dc9575e1c","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16576","last_updated":"2025-08-22T17:59:35Z","snapshot_observed_at":"2026-08-05T17:16:30.756058Z","submitted_at":"2025-08-22T17:59:35Z","title":"Benchmarking Training Paradigms, Dataset Composition, and Model Scaling for Child ASR in ESPnet","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16576","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Benchmarking training paradigms, dataset composition, and model scaling for child asr in espnet,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2508.16576","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:05fdf5acb5d927f368318fb1f187edea02beb1a4337ee973ec55febbd32c797f","observation_id":"cf1645f8-3434-461a-8948-80afd9fc8bd5","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05440","last_updated":"2026-06-03T21:02:28Z","snapshot_observed_at":"2026-08-01T13:50:07.459466Z","submitted_at":"2026-06-03T21:02:28Z","title":"Age-Aware Adapter Tuning for Children's Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05440","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Age-aware adapter tuning for children’s speech recognition,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2606.05440","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:4cf7bf47a9ac7cb9af98587fdfdca93a49b33b37cac8a6fad5918e7d888922d7","observation_id":"9d7d82cb-5f36-4840-b1d1-07cd311cce38","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Adapta- tion of whisper models to child speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:ecef4691586900fd7c5bf293a79c31bc22ff9cf8970961f3d79066724db14f7d","observation_id":"1f356347-e8f2-4821-a670-f2a2dec7f103","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Kid- whisper: Towards bridging the performance gap in automatic speech recognition for children vs. adults,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:ccc5e691303bc7a3281619ec081119e23196cee53464be361e41a60d2d96e065","observation_id":"a5fa2184-e235-4884-bdf9-981fbaa5269b","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Sparsely shared lora on whisper for child speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:c11510f0e90315b13d96e04c96981324b9deb12ab42f421ba36aa5f7a1f922e8","observation_id":"d364dd24-520a-4802-aed7-ba9d68c942ff","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Mind the shift: Using delta ssl embeddings to enhance child asr,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:766eb5f9a60401db00ba755fc2c7c87642400a5a6349886b82c9eea490e54758","observation_id":"e6eea29a-0f02-4711-b49e-46504bfec4e2","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07931","last_updated":"2022-06-16T05:28:31Z","snapshot_observed_at":"2026-08-03T22:21:40.237121Z","submitted_at":"2022-06-16T05:28:31Z","title":"DRAFT: A Novel Framework to Reduce Domain Shifting in Self-supervised Learning and Its Application to Children's ASR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07931","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Draft: A novel framework to reduce domain shifting in self-supervised learning and its application to children’s asr,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2206.07931","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:d4f2275c0ba735a3e6adbe907867ab3ef97e1289644784f647e4574fc8cd4384","observation_id":"d0cf11e4-c80b-4f40-9872-d593be6c74f5","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Towards better domain adaptation for self-supervised models: A case study of child asr,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:9c7eb20fea36775ef40af9dec85882ef42d4e991389d52f7b1113f8cc2db7a9b","observation_id":"e27b6f5a-3719-422d-8a9a-c9b369dcee6d","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"A wav2vec2-based experimental study on self-supervised learning methods to improve child speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:bc2782d3000d8cc2d280dc7b2f3a5ce5ab1b764685369903d429701a1d9a6284","observation_id":"c4ec6e42-ef45-49c5-adf3-78af585a0e37","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"MacWhinney,The CHILDES Project: Tools for Analyzing Talk, 3rd ed","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:1e84db51ab3a4898d0f9c5c0d641b249285624e6f2c77596411112a2d1feaec6","observation_id":"cc6dff50-6964-4903-89e5-d14399fb5ae7","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Montreal Forced Aligner: Trainable text-speech alignment using Kaldi,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:903a8086df424d9f53f18f8ddd16da1b6e30fb87527e408a6acfb8332cd2cb9d","observation_id":"0372b923-6ddf-4fb5-b3f0-4a49e9ceb7e2","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13516","last_updated":"2023-05-22T22:09:41Z","snapshot_observed_at":"2026-08-02T15:37:26.541116Z","submitted_at":"2023-05-22T22:09:41Z","title":"Scaling Speech Technology to 1,000+ Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13516","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Scaling speech tech- nology to 1,000+ languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2305.13516","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:5c073b99bb5f350cbd496d921154552b80bc68deb68b99560c2e00403b3d036d","observation_id":"10db3fde-f1e0-4ce7-a1ea-aa0756afa508","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"A recursive algorithm for the forced alignment of very long audio segments,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:db1bcccc29b086750f10fda58a0e883103e90f9d82c039e4829171e38224f936","observation_id":"fe52b86c-87a6-441f-ac0a-5789e6da6947","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"CTC- Segmentation of large corpora for german end-to-end speech recogni- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:c1e259d93404a9b583efd5b1fc7664921686a54bc3271bc212eefe14557b60f1","observation_id":"d2054911-28b0-4924-85da-c28ed5d8cb28","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"ALISA: An automatic lightly supervised speech segmentation and alignment tool,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:903a58de8f8e856e79188073ad8983f30e158319fc747daf1d75c7f43d288a82","observation_id":"c0ad31d2-13b6-4412-81a7-215ef6771313","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"A linear memory CTC-based algorithm for text-to-voice alignment of very long audio recordings,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:86951253ef7eba5e0732832ab11f4021e3bd631f8c7e5f82d4479b7e64c33b65","observation_id":"2868958a-e78a-4300-a523-ed68dca3a9d1","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-07T11:26:26.674534Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Whisperx: Time- accurate speech transcription of long-form audio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:d871377908e1c4d6399a015659793609cd1672b435c0388d9899cc1b4b63b6be","observation_id":"361e5e16-74c5-47ae-8b3e-ea557c63ff95","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17926","last_updated":"2024-06-25T20:37:16Z","snapshot_observed_at":"2026-07-06T18:37:00.469355Z","submitted_at":"2024-06-25T20:37:16Z","title":"FASA: a Flexible and Automatic Speech Aligner for Extracting High-quality Aligned Children Speech Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17926","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Fasa: a flexible and automatic speech aligner for extracting high-quality aligned children speech data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2406.17926","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:1e886ffa5f5013e84390c8ae5e181004318b2360fe29da65dae98d7acb02064c","observation_id":"137f1b7d-6156-464a-9c22-2fe1155205f8","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Kids: a database of children’s speech,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:e6e31781b6b827df6ffbf7fa9de2e5320f9ddadbf7a29bbd09c64954609f53ba","observation_id":"4ab0584c-1527-4ab4-9135-b0aa1dd0ff87","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"The ogi kids’ speech corpus and recognizers,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:34c211f5988132c78b4637f48da8cc765c222fe942f7b15cf4a83f7a8f213736","observation_id":"c2845150-f698-4698-8fb6-0caf0a69231c","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Multi-task learning for speech attribute detection of children’s speech","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:cf6a9d823ef4807c94f8970b053d23135359c4be556974e2ff46959fd0d2e07a","observation_id":"e77428ba-619e-4700-8a0d-b00b4983d70a","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Tidigits,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:808da8b5c5a3482c9f3a490cf4cbd5cf8f1b56dd7dd5969b68bd65fdc46b659d","observation_id":"6677960c-20d6-42fb-a4bf-baad9bcd6612","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Diagnostic accuracy of sentence recall and past tense measures for identifying children’s language impairments,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:281306d1135e9dbf9cc769c12abbc0b5cf73bebb99167f0e9b788342b065ffbc","observation_id":"c918ce5c-cb6f-4dd7-96e9-1fd550dfa13b","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"My science tutor (myst)–a large corpus of children’s conversational speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:34668036b3edbdf3a8a5b302edfa5e6a45d9e4e9cda78b908fd7bce1da4e6651","observation_id":"56738040-fe85-4093-8b05-ca2823401a80","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Children’s speech recognition with application to interactive books and tutors,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:b222d8be66995f5897b0057d2c5b80868bfade58939d6b90cc6429a9aeb7ed17","observation_id":"b1fee90d-852a-4d8b-a88a-5590c11d4cd0","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Word-minimality, epenthesis and coda licensing in the early acquisition of english,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:35d0b913020e3d0be4776358a2fbb5ca01098163e88ae46a5e5c3347ac67baa9","observation_id":"25740fac-9170-42c6-b108-189a31d876f2","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"The pf-star british english childrens speech corpus,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:78c86d18772f67b26aa7f06ebca733fa5d481c58faf03c678be5195d852312ef","observation_id":"f8b4f434-7997-4a46-a68b-d5bb3578039b","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"The pf star children’s speech corpus,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:397f3655040e8a0428b7cc9a2beb01f43a003f5a51a004309557deb9efd7464b","observation_id":"a7c23b33-c117-4e8d-9e9b-a0edb811bcc9","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Tball data collection: the making of a young children’s speech corpus,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:ee3e904c828fce81276e5004dc6ebf7abac2c08520bf2c35c19961d257e298ae","observation_id":"f43aae98-6b5d-4792-994d-cab74be4ac31","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"The kaldi speech recognition toolkit,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:b18e5801e5777694f599cef69d0686878dd2095c9fe3d1fde1e2a6b09647dc65","observation_id":"23982a50-fc91-4a06-a6df-2ee947950e9f","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Automation of Language Sample Analysis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:509bf855b9ca6796fb1a80260bfa70430c78b4e5dfce79628696d70b43a35fdf","observation_id":"ae4f7b59-57e0-437d-a786-9881aaf174bb","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Sailalign: Robust long speech-text alignment,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:b5f3bcf038c1471ac28345f2bea7c648cc57608c0607485427be527178527cb3","observation_id":"24ef8e9f-a56f-4161-b95b-b5ae0b6e5b7a","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Automatic long audio alignment and confidence scoring for conversational arabic speech,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:6795c67402ce1a24c33c854a060ab6b1a29a3dd172c101627eec0a80803a92ed","observation_id":"70e2ea42-bee0-4fc8-a0e2-9d903dfdb965","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"A post-processing system to yield reduced word error rates: Recognizer output voting error reduction (rover),","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:1be2bf3bc5568db11fed2135b8d5566c7c55610c3b171f69ccbd3ce5eed5b75a","observation_id":"419608c9-df5b-4d43-a2be-1219c68c41fb","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Ensemble methods in machine learning,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:885c758f87a46115a93ab0c8fab645ef9eef8e277a0e125edb9e8d91ee63d57c","observation_id":"7dc3eb10-507c-4b9c-8309-8f6895fa5132","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06795","last_updated":"2023-05-29T21:08:11Z","snapshot_observed_at":"2026-07-06T15:15:30.340543Z","submitted_at":"2023-04-13T19:38:27Z","title":"Efficient Sequence Transduction by Jointly Predicting Tokens and Durations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06795","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Efficient sequence transduction by jointly predicting tokens and durations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2304.06795","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:b8f59863eadedf4f2968cb5024dc64e96f7d9c4fde2560a5346a3d4846d6f807","observation_id":"11badae8-27a5-4036-ab28-cf3e05c5420b","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08699","last_updated":"2025-05-14T02:10:29Z","snapshot_observed_at":"2026-08-07T15:45:42.504949Z","submitted_at":"2025-05-13T15:58:57Z","title":"Granite-speech: open-source speech-aware LLMs with strong English ASR capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08699","snapshot_observed_at":"2026-07-12T00:48:21.716770Z","title":"Granite-speech: Open-source speech-aware llms with strong english asr capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T00:48:21.716770Z"},"links":{"cited_paper":"/paper/2505.08699","citing_paper":"/paper/2607.03670"},"observation_digest":"sha256:741a87d1d120470a6a8fad85532c55f45a6f67a81594769630effbe97ec44379","observation_id":"df653451-76cf-4596-bad0-1ab5861d3ae5","resolution":{"observed_at":"2026-07-12T00:48:21.716770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03670","last_updated":"2026-07-04T02:50:05Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T11:27:04.089670Z","submitted_at":"2026-07-04T02:50:05Z","title":"CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.03670."}