{"as_of":"2026-08-19T04:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8626d2aa50b8b373be8e559968a4b4945fbac55b63f9dfa2add0d538d4a4ec0a","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:37:58.527198Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:37:58.415460Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T00:37:58.604758Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"cited_work":{"arxiv_id":"2608.11587","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.11587","snapshot_observed_at":"2026-08-16T00:37:58.604758Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","venue":"eess.AS","work_id":"7429fcaf-dfff-4e9c-a577-14d6a6b92c96","year":2026},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.415460Z"},"links":{"cited_paper":"/paper/2608.11587","citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:533cd228df6df114e1fb327197275e0763b5e258a42a47386130bb85dc58e201","observation_id":"85931b77-fc6b-41e1-b17f-d272322f871b","resolution":{"observed_at":"2026-08-16T00:37:58.608986Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.11587/citation-record","integrity":"/paper/2608.11587/integrity","json":"/paper/2608.11587/citation-record.json","paper":"/paper/2608.11587"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.857892Z","title":"Depending on the label taxonomy, the task can be formulated as speaker diarization, vocalization classifi- cation, or a combination of both","venue":null,"work_id":"334eae69-657a-4ec7-ab8e-82a0d2c12fd2","year":null},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.410982Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:b0978cb61a3cc0589bb91592e8bf640ee328ce7350999c23913f4705f89bc3ee","observation_id":"2f19e0b3-41b9-4b0d-966f-c8e930a8b1d8","resolution":{"observed_at":"2026-08-16T00:37:58.861913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"cited_work":{"arxiv_id":"2608.11587","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.11587","snapshot_observed_at":"2026-08-16T00:37:58.604758Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","venue":"eess.AS","work_id":"7429fcaf-dfff-4e9c-a577-14d6a6b92c96","year":2026},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.415460Z"},"links":{"cited_paper":"/paper/2608.11587","citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:533cd228df6df114e1fb327197275e0763b5e258a42a47386130bb85dc58e201","observation_id":"85931b77-fc6b-41e1-b17f-d272322f871b","resolution":{"observed_at":"2026-08-16T00:37:58.608986Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.847791Z","title":null,"venue":null,"work_id":"6fc5c9d0-c881-4be4-a9d8-ed024fd3c403","year":null},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.419450Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:c7f6a28757f8f0a1af6fc1fe311654134e06473398b24a55e7379b8133207aa1","observation_id":"5613fc63-21f2-4f34-86c2-ab752e73caca","resolution":{"observed_at":"2026-08-16T00:37:58.851409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.836668Z","title":null,"venue":null,"work_id":"5743cd10-fa8f-485c-a059-d5d90f52f278","year":null},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.423648Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:745e927a315b5a23a53e4d4d7cbdca65af42658a556f3408513a18e7cd8bdf5c","observation_id":"f893d402-5bae-476b-a70f-272e3268979d","resolution":{"observed_at":"2026-08-16T00:37:58.840046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.826864Z","title":null,"venue":null,"work_id":"0e302d54-1ed0-4c8c-97e7-f41ae2fa1efe","year":null},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.427581Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:e8353867c9ef8c1fda6a1f0f4d6de7d6668894cc463b42069574d8ead6aae8a7","observation_id":"e6dcbee3-c214-474a-a2db-b41e1dee46a5","resolution":{"observed_at":"2026-08-16T00:37:58.830443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.815573Z","title":"w/o LoRA","venue":null,"work_id":"666842bb-b5ff-40f4-ac4d-687a0fffc302","year":null},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.432051Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:58c704b9c31bd0111c197cf96cfc22684e02cde03d6a75d0b2077d3812743cd5","observation_id":"340c13f6-98fb-4592-882b-7fa2a8ae33e1","resolution":{"observed_at":"2026-08-16T00:37:58.819694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.804680Z","title":"In the current design, offsets are learned only for training families, and inference on new families relies solely on the shared tier tokens","venue":null,"work_id":"14b4a4a9-b573-43ad-b70e-d5ecabb85970","year":null},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.436080Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:a731a7ddf2d8135c7e1920d7acf3040547df18c74320a4a0bec9b289a58e47c5","observation_id":"9ef79544-396e-4c91-b6a9-22f6905adf36","resolution":{"observed_at":"2026-08-16T00:37:58.808612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.794015Z","title":"By combining a LoRA-finetuned Whisper encoder with structured speaker conditioning and tier-specific heads, the model supports overlapping speakers and framewise prediction","venue":null,"work_id":"753ccbca-206f-4acf-9a7b-693a35ba90fa","year":null},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.440202Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:657ff7511acacea237001b01c521b9d931bf66d75adb777460c600a3458a9b07","observation_id":"be981798-466b-42d9-9a9d-cf5eda55c8a2","resolution":{"observed_at":"2026-08-16T00:37:58.797765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.782198Z","title":"All technical content, experimental design, analysis, and scientific contribu- tions are entirely the work of the authors","venue":null,"work_id":"c46f6c3a-a475-4578-bffe-ee9bb91d17f7","year":null},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.443926Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:86a1dc516574ead7d89d81248c9a9f2124f287f620e91a3ebf105009a6e64ccb","observation_id":"066d5771-9987-4c7c-b5d0-0cfb4e7f08e6","resolution":{"observed_at":"2026-08-16T00:37:58.786849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.771949Z","title":"For the experiments presented here, we used the Delta System at the National Center for Supercomputing Applications through AC- CESS allocations CIS240417 and CIS250040","venue":null,"work_id":"fa4e8d0b-1eb8-48c8-8e9f-0a27a3b648fb","year":null},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.447533Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:7f8d6cfe7335b4a6c2de33c1e9849439222ae37ef183ff1b99fef2f8d6b5ba83","observation_id":"d39187cc-5b69-49fa-986e-d7bed726bb28","resolution":{"observed_at":"2026-08-16T00:37:58.775753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.760981Z","title":"An open-source voice type classifier for child-centered daylong recordings,","venue":null,"work_id":"c6158efe-3280-4596-a323-d15e7ce811f8","year":2020},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.452612Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:088a1d2686f0b734cc1fc70d38d7910314e9558fe987aee72d213c08870b6c74","observation_id":"d43b58f2-4d25-4582-9e8b-d163416162ab","resolution":{"observed_at":"2026-08-16T00:37:58.765244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.749588Z","title":"Analysis of acoustic and voice quality features for the classification of infant and mother vocalizations,","venue":null,"work_id":"f1230a53-8d9b-41cf-bbdb-073d12273977","year":2021},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.456733Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:5c0231b9661cb277a92239523108e1ab7dbc161abad9b0380427f9f7f802f6ae","observation_id":"1f08f8ed-e446-422d-9de2-b712e32e509c","resolution":{"observed_at":"2026-08-16T00:37:58.753786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.460817Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.460817Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:191d4ad5a97b0beb8bc93d815a506e575718cecc362d1cf887c82597c04efd49","observation_id":"83c5e8d7-f678-4bad-9126-b99b602b2ce8","resolution":{"observed_at":"2026-08-16T00:37:58.460817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.464621Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.464621Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:7fb24f2ecf9b33de374e6b78ff9f9ab195c9539e407553228069f295cc2bddc3","observation_id":"81970ea0-3654-40c7-ab9e-089bdb55826d","resolution":{"observed_at":"2026-08-16T00:37:58.464621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.726754Z","title":"Ssast: Self- supervised audio spectrogram transformer,","venue":null,"work_id":"0ed824c4-01e2-407a-acfa-cd9a805ecbd9","year":2022},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.468293Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:32c714e69da1dbffef40476dae905a7c40f632a865bfc7d1b68f726ff1d98955","observation_id":"7f723355-a9d6-45ef-a69c-6f5b0f6b1486","resolution":{"observed_at":"2026-08-16T00:37:58.730392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.714742Z","title":"Towards ro- bust family-infant audio analysis based on unsupervised pretrain- ing of wav2vec 2.0 on large-scale unlabeled family audio,","venue":null,"work_id":"2dc75966-d6e4-401a-939e-176d49e478a8","year":2023},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.472056Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:53b353d3cdd870c4426ea57cee233fda9965bcb0090c8c0ce496e64254089b71","observation_id":"ca0306a4-6514-4e7f-bd3d-fe7c070f8be9","resolution":{"observed_at":"2026-08-16T00:37:58.719171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.703865Z","title":"Band- split self-supervised mamba for infant-centered audio analysis,","venue":null,"work_id":"976a9549-6338-4494-95a3-7120fb2e914d","year":2025},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.475453Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:dc820c6d4a60f52fd6b72e8ba0ef7e88bcb037b416b8ed6463e378a56860f1eb","observation_id":"d1fc9b1f-8512-4744-945f-4c449bdaf826","resolution":{"observed_at":"2026-08-16T00:37:58.707606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.693487Z","title":"Robust self supervised speech embeddings for child-adult classification in interactions involving children with autism,","venue":null,"work_id":"eec0c066-0a5b-44ef-a598-b6eb6e6f60a9","year":2023},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.479443Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:de461581431fd02e418de87b0443b600dde3732a58a396daf7bfb24b3d5a021b","observation_id":"fcab2698-f3fd-4943-b7ad-08bba330d823","resolution":{"observed_at":"2026-08-16T00:37:58.697393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.482950Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.482950Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:2390da6bff48dd9aa1cdc4bdbdf0c853c2fb7d18198eb6fa2450f46aac46e33d","observation_id":"10861f42-de29-4d87-9f7b-df53877a8d01","resolution":{"observed_at":"2026-08-16T00:37:58.482950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.486408Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.486408Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:dfab9c978fec4381b02e6ff17c40d72078e19b88be096d5756cdcbb795d8d5d3","observation_id":"44225a6c-1bc8-40df-aeea-ee68f5961914","resolution":{"observed_at":"2026-08-16T00:37:58.486408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.489633Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.489633Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:571645569814e4ee43569196b4e8523142d6fe718e0b7d1d8fc77cafee969af6","observation_id":"9f4cbe6a-f1ec-437d-9ef6-05e396f4b027","resolution":{"observed_at":"2026-08-16T00:37:58.489633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06619","last_updated":"2024-06-07T08:01:51Z","snapshot_observed_at":"2026-08-17T16:15:38.360635Z","submitted_at":"2024-06-07T08:01:51Z","title":"LoRA-Whisper: Parameter-Efficient and Extensible Multilingual ASR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06619","snapshot_observed_at":"2026-08-16T00:37:58.493362Z","title":"Lora-whisper: Parameter-efficient and extensible multilingual asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.493362Z"},"links":{"cited_paper":"/paper/2406.06619","citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:1a5249739931de5f1960f88baa640efc04630819123371361ee0f37115ca979c","observation_id":"3699ebe0-0dce-4014-9e6c-6b81f38bd462","resolution":{"observed_at":"2026-08-16T00:37:58.493362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10680","last_updated":"2024-08-20T09:31:59Z","snapshot_observed_at":"2026-08-16T13:25:16.915210Z","submitted_at":"2024-08-20T09:31:59Z","title":"Towards Rehearsal-Free Multilingual ASR: A LoRA-based Case Study on Whisper","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10680","snapshot_observed_at":"2026-08-16T00:37:58.497599Z","title":"Towards rehearsal-free multilingual asr: A lora-based case study on whisper,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.497599Z"},"links":{"cited_paper":"/paper/2408.10680","citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:711d4dba2b9c6d1217a8768c00235940bdd51558547cab9eb3746743dc3f10d6","observation_id":"a4e021d2-ec4e-49c0-9e39-b22a74218af4","resolution":{"observed_at":"2026-08-16T00:37:58.497599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.664132Z","title":"Sparsely shared lora on whisper for child speech recognition,","venue":null,"work_id":"60aabceb-0c13-4524-a53b-8369f3186388","year":2024},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.501666Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:27a0178b6af7f7d0b5a4fbb16e68aaaf2b7f0f03c9dca98cea85c57d213d17f7","observation_id":"fbbf2178-691b-4d7d-8502-b2cfebee8cde","resolution":{"observed_at":"2026-08-16T00:37:58.667830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.653753Z","title":"Whisper-at: Noise-robust automatic speech recognizers are also strong audio event taggers,","venue":null,"work_id":"8ae4ffed-c824-434d-a9f6-0ba9631a8156","year":2023},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.504948Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:7cdf6dab6736cfeb097785c3043572868df30f6601d07dba397e6b66e2401d30","observation_id":"f7800dad-1039-4625-9f92-e59fc25be48c","resolution":{"observed_at":"2026-08-16T00:37:58.657405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07890","last_updated":"2024-06-12T05:41:01Z","snapshot_observed_at":"2026-08-16T13:43:54.447077Z","submitted_at":"2024-06-12T05:41:01Z","title":"Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions","version":1},"cited_work":{"arxiv_id":"2406.07890","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07890","snapshot_observed_at":"2026-08-16T00:37:58.568163Z","title":"Exploring Speech Foundation Models for Speaker Diarization in Child-Adult Dyadic Interactions","venue":"eess.AS","work_id":"c1d2b759-415e-4e12-accc-920f238df529","year":2024},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.508242Z"},"links":{"cited_paper":"/paper/2406.07890","citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:99d7629c28733e680b07d28604547db9f9923ef1568dd6df8d6e94f52d69e556","observation_id":"03a70b6f-972e-482f-b23b-f5fd29698aa4","resolution":{"observed_at":"2026-08-16T00:37:58.574313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.512279Z","title":"Data efficient child-adult speaker diarization with simulated conversations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.512279Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:27aa07ac2c6fddeba2be625e7196f7670af594476a70a6e1da3e63fe084f1800","observation_id":"262b03b5-6715-41b1-b411-9ad2b52a825e","resolution":{"observed_at":"2026-08-16T00:37:58.512279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-16T14:18:48.581750Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-16T00:37:58.515987Z","title":"An embarrassingly simple approach for llm with strong asr capacity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.515987Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:a56e2b0dabc48f82f58aef242e89b9a12932cb2b78aca82f981083ce19747a8c","observation_id":"03d92929-91e8-4f51-8300-d15577639681","resolution":{"observed_at":"2026-08-16T00:37:58.515987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.637424Z","title":"Preliminary technical validation of LittleBeats™: A multimodal sensing platform to capture cardiac physiology, mo- tion, and vocalizations,","venue":null,"work_id":"b9f1e9f1-0309-4a1a-9f49-6407024ff6d8","year":2024},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.519766Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:4042d513c16c0dbc657f85be43ceb0ce70ec675b6cffec7fd631d90a4d7f3fbd","observation_id":"2f633839-6a74-45d0-9798-85f6edf2048b","resolution":{"observed_at":"2026-08-16T00:37:58.641316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.627511Z","title":"Praat: doing phonetics by computer [computer pro- gram],","venue":null,"work_id":"b7c7b79e-eb21-4ed4-ae13-56ffdffc44c5","year":2011},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.523640Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:de0b5c51ff5a1396bd6367b1a007b062a3c84fb16abb272ecc5b9e54fb64314c","observation_id":"173baa84-40d6-484a-aede-d591008a6fb9","resolution":{"observed_at":"2026-08-16T00:37:58.631037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:58.616378Z","title":"Listen, adapt, better wer: Source-free single-utterance test-time adaptation for automatic speech recognition,","venue":null,"work_id":"cca2d72f-6164-44b9-a6b1-31cebd726d53","year":2022},"citing_paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:58.527198Z"},"links":{"citing_paper":"/paper/2608.11587"},"observation_digest":"sha256:75dadd66f23b777666ae5a520e7449a467978f56a4e0629942b41461d3476e39","observation_id":"8038aa1b-a8bd-48ef-8431-969e39e68630","resolution":{"observed_at":"2026-08-16T00:37:58.620077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11587","last_updated":"2026-08-12T02:55:21Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T17:15:39.796967Z","submitted_at":"2026-08-12T02:55:21Z","title":"Robust Multi-Tier Infant-Centered Audio Understanding with Whisper via Structured Speaker Conditioning"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2608.11587."}