{"as_of":"2026-08-08T15:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d3942892632ce62d6ead0fcf703ebf5513cd8185c028fef649f57e97e1132ba","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:11:03.723969Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:11:03.723969Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03201","snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"arXiv:2607.03201v1 [eess.AS] 3 Jul 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"cited_paper":"/paper/2607.03201","citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:800d3806bb73ed15991215a2ad83510c5bdaa75424fbc6f80fb4fd92698799f3","observation_id":"493c40f2-70b9-4090-a8da-2532555204c5","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.03201/citation-record","integrity":"/paper/2607.03201/integrity","json":"/paper/2607.03201/citation-record.json","paper":"/paper/2607.03201"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"However, three problems have prevented LFR corpora from be- ing fully leveraged for speech tool development and evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:b46219264c452e923d2d68e18fc023d90079756083da6bc77bf8dc9d9f8ca0fa","observation_id":"6c23bb2c-e763-4bc8-9aa0-9fc481a64fb8","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:df6fe96460bad4097e89f635df8028319791ef25870696fa84d27805c811b1a5","observation_id":"cea2fade-2334-4ecc-aebf-601ad16d9287","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03201","snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"arXiv:2607.03201v1 [eess.AS] 3 Jul 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"cited_paper":"/paper/2607.03201","citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:800d3806bb73ed15991215a2ad83510c5bdaa75424fbc6f80fb4fd92698799f3","observation_id":"493c40f2-70b9-4090-a8da-2532555204c5","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:ed03e2077ec673f7f308467f763f674a64167fc48926cf2551c72ac68ac8d4aa","observation_id":"7221d4a9-815c-4a81-9c12-c81d0ab33a25","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:de4fba9c79028b2d8ef7c2cb159625d3a1853e75a77aa568e357aed00c0eeec0","observation_id":"ba52b736-c9c3-43c7-8b2e-ac3f92d90bf1","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"friend” or “cousin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:0d0db64fb970290280faf5fec7a5919f84330257d917c07e106135f83f89cc98","observation_id":"efa2ac19-1132-440d-a2c3-16688456a203","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Without systematic governance, the collection risks either over-restriction, which limits scientific progress, or under-restriction, which compromises participant privacy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:2b7341cd50ce26ecd63faa9a5b1bd492c95edaecac54366390a56ebc0c79da3f","observation_id":"53def726-fe24-45c9-aca2-407fb833f018","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Retraining on public data alone yields substantially lower performance than the state of the art (44.4% vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:2afdd5b1267c36beab69c818ef9a8669fb5cdc3311a110ee160bde49e0646e02","observation_id":"023928f3-e9bf-44d3-9cc1-76faf17b6f9d","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"KS, LB, TK, AB, LP, ST, and AC were supported in part by the J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:33129a06ccdfcaaff3439f35cf5ef81af685643bbbbae7a3bf26a6018ac87ced","observation_id":"73d2c11a-8ed5-4c08-990a-bd4f5671d14e","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"All scientific content, methodology, ex- periments, analyses, and conclusions were conceived, verified, and approved by the authors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:b944ce78aca867b6c6ae421a4dbdfc06902040be9cbdcff1dc500bd25578f72b","observation_id":"a4a0ee3c-a520-4b88-a513-2badf2d64077","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Daylong egocentric recordings in small-and large-scale language communities: A practical intro- duction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:71671e02f550a84bf3cdfb56e365bdc1d4205f26265af98d7da6135c744d417a","observation_id":"87c4a761-dbc4-47f6-8d3b-7af20da22c16","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Longform recordings of everyday life: Ethics for best practices,","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:75b68295c5e8c2822bc1acd418a9f23419d6668ab2b015a7fc3d5ba3178ed8a7","observation_id":"4fbfba34-e7c4-4fdd-a735-392ecbb44172","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Fifteen Years of Child-Centered Long-Form Recordings: Promises, Resources, and Remaining Challenges to Validity,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:7c196622334035d67a51f44bd90d78ccba0ff7ca58a79f0e0667ed9c3371d714","observation_id":"0d844b1f-673f-4fe5-b402-34fd9f58d374","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1055/s-0036-1580745","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Homebank: An online repository of daylong child-centered audio recordings,","venue":"Seminars in Speech and Language","work_id":"040eb749-07e5-4863-af36-40662adc8032","year":2016},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:f4a5a90cb145cd8cc963cccc799233eb70b1b4266fdcd57b9bbc156e04420b7e","observation_id":"0a970361-c390-4330-85e5-a5872203716d","resolution":{"observed_at":"2026-07-12T04:18:29.403539Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:20.365215+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:20.365215+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Practical solu- tions for sharing data and materials from psychological research,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:9762d2808eca7d0516353df93beb2499772d0db5a45d2679bbea6f5f2b22531f","observation_id":"2f9904eb-976b-4c71-929f-88ea95341991","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The LENA natural language study,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:ac053a3ba8b3f1d653e0856178a8d21f6f878391253aa72fca5dea605e6beb80","observation_id":"aa075210-7c92-484a-8fdd-df1c70a99f35","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Babyhubert: Multilingual self-supervised learning for segmenting speakers in child-centered long-form recordings,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:eae5ece0f868b86d19e444c6c2effc02ba0cfcada6a223b049438f0cb4d7ef14","observation_id":"d5fdebf4-c678-4a73-ac49-2d939638aea0","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15001","last_updated":"2026-06-29T13:06:46Z","snapshot_observed_at":"2026-08-05T23:26:08.097511Z","submitted_at":"2025-09-18T14:34:17Z","title":"BabyHuBERT: Multilingual Self-Supervised Learning for Segmenting Speakers in Child-Centered Long-Form Recordings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.15001","snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Available: https://arxiv.org/abs/2509.15001","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"cited_paper":"/paper/2509.15001","citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:84dfbdc8d190d15a073f007f47ae526ac34beefe68890e4012abc0c0c785f466","observation_id":"888dcef7-0ea1-4f2f-afb2-793b987d7be0","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"A new workflow for semi-automatized annotations: Tests with long-form naturalis- tic recordings of childrens language environments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:d3a2161654029a3ade5051e08d89b12f5e9733b487016341239e5250efc29a2c","observation_id":"9eb49bb0-cd8c-414c-bf88-14c5f659c796","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Managing, storing, and sharing long-form recordings and their annotations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:05dcb011a34d3459b3342bbbac458a2e01763b506707369779b1d4112214ed25","observation_id":"2fa911fb-0aa5-458e-a8b5-8527efb289ee","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"From childes to talkbank,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:c5709cacfdf0656695a5ffebdcd08b6325492d8e90e341549b0582f80bb269c8","observation_id":"8e2c4aab-4605-4123-baf5-0116ec56dcb9","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Ticuna (tca) language documentation: A guide to ma- terials in the california language archive,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:10596eab6806ef6fce8b69113817146c6c9b63a6d32b93fac2204638404aec56","observation_id":"d8720636-63d3-4388-a7bc-9956942dff2a","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Demographic biases in naturalistic language recordings in the childes database,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:d2c20529b9545ac26aa4f2327b9006f06f0addb6cc9a4b42e7e6144557321dd8","observation_id":"48c14eeb-f97f-4129-a2db-6a06d4b8c9d5","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Systematic inequal- ities in language technology performance across the world’s lan- guages,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:8e878d1d4ca0a3479217a9740f7ca55cfa86c76100e2871b25b5d09d1191304a","observation_id":"c8ab55f5-178f-498b-8270-d14e74c4dd7e","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/0907568202009003043","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Appropriating cultural conceptions of childhood: Participation in conversation,","venue":"Childhood","work_id":"6705f803-b366-4738-828a-5e277c9e4df5","year":2002},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:f4050f56ca3abcbe1fcf04a76a20994a2761fb1500eb2efb61a05ee56fb69dc8","observation_id":"cd96ba7e-731f-4ba2-84b9-d8492389a234","resolution":{"observed_at":"2026-07-12T04:18:29.391418Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:20.602665+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:20.602665+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Word-minimality, epenthesis and coda licensing in the early acquisition of english,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e5c73513460fc3bb5ff16db421484ac5ecf4a98e9dd62aec041f4e2bcf86fa73","observation_id":"4d463c2c-aab2-4eba-9d7b-444aeed17e08","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Acoustical cues and grammatical units in speech to two preverbal infants,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:d3a562969551da6cb640f4d85176fa368157ea0ca7dcbb4bf63aaa90b8368c6e","observation_id":"fef3fc8c-96ce-49cc-ac02-3041e0f05a63","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1515/cogl.2009.022","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Two-year-old children’s production of multiword utterances: A usage-based analysis,","venue":"Cognitive Linguistics","work_id":"0b171c74-69dd-4eb9-a737-68f598e10e95","year":2009},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e904db85ae342fe5a747f4845ba76acd08f4d34299d386cf95c8d480d1b69686","observation_id":"50dd8b4d-6662-41ad-93b2-3e40a0a4e22d","resolution":{"observed_at":"2026-07-12T04:18:29.395696Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:21.146395+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:21.146395+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Construction and automatization of a minnan child speech corpus with some research findings,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e7a192650474b9e8323f07db445a1cf1aba9820adee086212bc51f67dee88574","observation_id":"1724b42c-f9f5-4630-afe4-6ff7fcaf0844","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Ticuna conversations, 2018–19,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:836cf2698e3eac4c042d5d99835271ecd40d99be8babc5b8870f8a3bbaeebf37","observation_id":"652381e1-481b-4a72-a166-6656643d027b","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Available: https://cla.berkeley.edu/collection/ ?collid=11179","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:a8ef1b2781e23b2eed47a0c291a75c2029e29664e9bee54fbb6fb9ba2b7fd760","observation_id":"d61a3686-859f-42ed-9c96-bcac1a170234","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"BabyLogger versus LENA microphones: pilot study,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:2898e468686ebc2630206a85f39233f86a7110a0cab7b6c5c6330254d1988aa3","observation_id":"8c63cf4b-a0a0-49ca-b560-cb7da024fe85","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Bergelson Seedlings HomeBank Corpus,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:6bc50e69708bf03e5e4cbaf8ba5bd1b105698d8bc5254ca2061a5d21515b2bdd","observation_id":"c254fe58-53a6-4ff9-a9ed-bb6134ba4a40","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"VanDam Cougar HomeBank Corpus,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:f01b07a077174e8b390a7251dcfe89d430b7a6ed43e10791aae99261aa55c911","observation_id":"bda4ba76-4421-4436-aea9-bacdfba9ba5f","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"FauseyTrio HomeBank Cor- pus,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:7ad8cdc0cc928acaebac93fc8330626a875b869d7da066f4319219351eeeb70c","observation_id":"09c397e5-ecea-4b29-9bb7-19ce281c6953","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The relationship between reciprocal family interac- tions and the language development of the younger sibling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:138b051e1af46b9a9217d5ec4b61d48062a7712bcd9e2a601b9ef2f1a4d19425","observation_id":"434e5233-570c-4ce7-a1c6-0ff10861a573","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"A lon- gitudinal long-form dataset of 6–18-months-old Japanese infants’ auditory home environment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:bec7be136ccd9015e2fb94f80ba1d4d913a0da71edfa375ab5f14a412e6e5627","observation_id":"c764497e-e8bf-45b3-a974-3c29ee389582","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The language 0-5 project,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:6b865e791bbe09e51a94b507e7b784242e7b8bde6a34921b98d88beca918cfed","observation_id":"1cdd2878-72b0-4eee-8567-8de5abfbd3ae","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Lyon HomeBank Corpus,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:7e5801fa298b7e0a69939cd12cc0715cb391af03a8ddeceab85ceba7990cf2cb","observation_id":"329d5bf0-44a9-4034-be12-7b1830a421ed","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Long-form recordings from chil- dren growing up in various places in Namibia,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:62ed963f5a674d3a9b5a9fb24f13bfb914f9cdc036645774b9fcc13749039518","observation_id":"85811ad9-da55-4326-883c-27fc5ef13acb","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"PhonSES: A pilot study to measure socioeconomic status association with infants’ word and sound processing,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:9c271d7f6fcaf2cbf6afedac503c476da31d71adac0d2ac5ee49a9ab6a9d4e68","observation_id":"77e767d6-a680-44bd-bf2a-3e99b2311b3b","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Available: https://gin.g-node.org/LAAC-LSCP/ phonSES-public","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:2f1af508f42fb32804b46845795da8070d802b4ea6a719856a5c5878db9d8514","observation_id":"c525de25-f61b-4fb6-a966-9311425cf1a5","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Early language ex- perience in a papuan community,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:8836d4cfb6126f496aec35efbe3db30dc6a5933f145a7645a1ec5300dd14e16b","observation_id":"e7172ae7-703d-47dd-ba7b-c98983f6fd37","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Long-form recordings from children in rossel island","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:4f728a14c2dc48ba9ff55830877a257f5ffdf0b1c59368edb31bd586a691f254","observation_id":"e3699ea9-a44f-46ca-b9e2-7d987d1e1f6a","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Cychosz HomeBank Corpus,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:d8d62cee60247a71f83c15a278a9d22d2f943076126d3155204bbf04537cfb90","observation_id":"488cec49-a495-44bf-8ffc-1e15348b9e77","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"It makes a village: child care and prosociality,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:f18e2115d5d592155d0f2897336d1d1447abda75cdcff2962c3e85a40fff409a","observation_id":"b648cd91-a2e2-46fd-b498-9bbb06fff5cc","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Long-form first-period recordings from children in timor-leste,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:14e0f1eb43ce6d0b42d850c6cc61fcb9e8dd326a27e5f5c77ebd1e63ec4a3b03","observation_id":"14cf2e34-2979-4a7a-bc0b-8edeb6b65552","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Casillas Home- Bank Corpus,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:102d179d7dbff2fabea5fce712ae1751ea5aebd6d4e5072a9ed8e24792790708","observation_id":"087c5e0c-e2c0-4a73-bb96-9e83c2b1aabd","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/infa.12568","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Characterization of children’s verbal input in a forager-farmer population using long-form audio recordings and diverse input definitions,","venue":"Infancy","work_id":"cc16b331-ba4f-4b6e-a4cb-0bcb54b7352a","year":2024},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e73445e7ac31dbeded776513c181253cceb186fbda52b170245043f92501b8e3","observation_id":"2c1bf370-8e3f-4284-b8a5-b65a4526172a","resolution":{"observed_at":"2026-07-12T04:18:29.382568Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:21.399613+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:21.399613+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/desc.13375","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V ocal input and output among infants in a multilingual context: Evidence from long-form recordings in vanuatu,","venue":"Developmental Science","work_id":"909150d9-1a01-4b06-969c-cb7e06170e2b","year":2023},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:63fcc3051b219418da0df9e2f90a324286a184cce2bb0c99b77358293627a182","observation_id":"e27e2d4f-b697-46e7-9dbe-f45203704df6","resolution":{"observed_at":"2026-07-12T04:18:29.387055Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T19:50:21.724413+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T19:50:21.724413+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"San Joaquin Valley HomeBank Corpus,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:d1b52b296954e107214b3183a74985785f3361fc78892807b27c52825cb0ac27","observation_id":"9bb4d0bf-f6c9-44de-b7f5-43cb71cdfad1","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Winnipeg HomeBank Corpus,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:f79a6217ff8cd32dca96d77dbc0330756e12f3e033016d6957e6804c4a314e0f","observation_id":"f73928e5-5649-4beb-816c-fba5677d6703","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The interspeech 2017 computational paralinguistics challenge: Addressee, cold & snoring,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:7f1ec0ec2758e930e810334532eb92846abce45ff2a60b614ed94ddaea6bb7b4","observation_id":"0aad8b52-0f3d-4792-bd3b-612a84ba3243","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Developing a cross- cultural annotation system and metacorpus for studying infants’ real world language experience,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:e48d20becb3248d52ac5b664c7b7acf19318208f4f4457f6276d2ed5d74bc666","observation_id":"e008eec9-595a-4cee-89df-88611b3eba67","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"The interspeech 2019 computational paralinguistics challenge: Styrian dialects, continuous sleepiness, baby sounds & orca activity,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:ebd57b9dcc87d2e9f60ba7c8d58682f456be66b99f6de141f74ae1f06ba932c1","observation_id":"09941087-ebbc-4c89-8566-e01c501e8816","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Employing self-supervised learning models for cross-linguistic child speech maturity classification,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:076b81ebbb06e1fa1fcdaa46aa9f55467ba5f1801c59264cac75ab8fcf7f05aa","observation_id":"5c2133ec-94a7-47ac-910d-dd72dbabb1ed","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08999","last_updated":"2025-06-10T17:20:02Z","snapshot_observed_at":"2026-08-08T01:50:12.155817Z","submitted_at":"2025-06-10T17:20:02Z","title":"Employing self-supervised learning models for cross-linguistic child speech maturity classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08999","snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Available: arXivpreprintarXiv:2506.08999","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"cited_paper":"/paper/2506.08999","citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:8ee58ecfda312b078c53c6d2fd66dd7e304e972de344957584a200c05d28b2ce","observation_id":"c0adee27-d937-4107-9d09-7d99c3a63052","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:11:03.723969Z","title":"Decoupled weight de- cay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T04:11:03.723969Z"},"links":{"citing_paper":"/paper/2607.03201"},"observation_digest":"sha256:d3efd57af1308b05bcb45b94d965efaccd46d3e24afbcfc21d2f0c936ca2b163","observation_id":"7b156a03-78d1-4b6a-b6a5-8eab03e7d3c8","resolution":{"observed_at":"2026-07-12T04:11:03.723969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03201","last_updated":"2026-07-03T11:14:54Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-12T04:11:03.536354Z","submitted_at":"2026-07-03T11:14:54Z","title":"Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2607.03201."}