{"as_of":"2026-08-08T02:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7f1c0a68f51b900cce4b5743c577d56fb3791dc401158e34549edec112cb72e","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:32:30.776033Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.10349/citation-record","integrity":"/paper/2506.10349/integrity","json":"/paper/2506.10349/citation-record.json","paper":"/paper/2506.10349"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.216879Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":"5008c276-23a4-445c-8878-a03c08661e03","year":2023},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:27.650243Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:8513467bed8af83a063271d532ca17e926d6f9fbe9284580babf3a65c6e6cfa1","observation_id":"a56eb7fb-e67d-4b8a-ba72-b8af49fc8c6e","resolution":{"observed_at":"2026-08-07T04:32:32.220372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:27.749181Z","title":"A review of speaker diarization: Recent advances with deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:27.749181Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:cf63ddebb5fa9a0bea1b040e9175ae67b6fb222af7bde6c96389b0aa0ccfe340","observation_id":"a499c853-59cd-44d6-95fc-4aa43855ff14","resolution":{"observed_at":"2026-08-07T04:32:27.749181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.197863Z","title":"Joint vs sequential speaker- role detection and automatic speech recognition for air-traffic control,","venue":null,"work_id":"2eb30079-a800-470c-b492-3fb5340090ca","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:27.859759Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:d1f0c34f8c4d7e7a7d3248ae814f8830fcfc4d16a4e23ce9ad455f37a6eb8c1d","observation_id":"c6aa7b7a-10db-4bbd-a7ea-4ac0cfda46f3","resolution":{"observed_at":"2026-08-07T04:32:32.201669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05337","snapshot_observed_at":"2026-08-07T04:32:27.969261Z","title":"Joint speech recognition and speaker diarization via sequence transduction,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:27.969261Z"},"links":{"cited_paper":"/paper/1907.05337","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:0f34cfc6ecab47f53f3cd2505ad8a5a2e89523eb19b1b1c53ed4d8bd29771196","observation_id":"d9b4c47a-ad4d-405a-b808-72a72c24843f","resolution":{"observed_at":"2026-08-07T04:32:27.969261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.186989Z","title":"One model to rule them all? towards end-to-end joint speaker diarization and speech recognition,","venue":null,"work_id":"f6674e09-a9fb-4cbd-b8b6-5d3527eea20e","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.088900Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:d74e8ca9fca20a9d5de761a8171e7d24fc6d5ee72417a0f16f9683af687cef34","observation_id":"d2e40b0a-8d3b-402b-a795-1c6e9919c25c","resolution":{"observed_at":"2026-08-07T04:32:32.191045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06656","last_updated":"2025-07-19T18:18:34Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:20:11Z","title":"Sortformer: A Novel Approach for Permutation-Resolved Speaker Supervision in Speech-to-Text Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06656","snapshot_observed_at":"2026-08-07T04:32:28.219916Z","title":"Sortformer: Seamless integration of speaker diarization and asr by bridging timestamps and tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.219916Z"},"links":{"cited_paper":"/paper/2409.06656","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:d4d2a952eda8b6ab23e0d54f1dea9d973478947f5f943861732a808d3570e714","observation_id":"df57b59b-7deb-4786-a949-d47497047a53","resolution":{"observed_at":"2026-08-07T04:32:28.219916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12687","last_updated":"2020-08-08T20:08:37Z","snapshot_observed_at":"2026-08-04T07:16:40.156853Z","submitted_at":"2020-03-28T02:37:09Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12687","snapshot_observed_at":"2026-08-07T04:32:28.346093Z","title":"Serialized output training for end-to-end overlapped speech recognition,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.346093Z"},"links":{"cited_paper":"/paper/2003.12687","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:31f0719c0ce61adb9bd1c5520bad609562c42adc40f2cc3b1ce56ac1ed9fe46c","observation_id":"88a4f7d2-0faa-4bff-8e09-ef6eadc0959e","resolution":{"observed_at":"2026-08-07T04:32:28.346093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:28.501651Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.501651Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:f7cb86153f2f8a801dbc9c97d1a58bacb20f1aa024b3044a21c3e8f4d87b58f5","observation_id":"02be410a-d15b-4189-acfc-7e06fdf39b44","resolution":{"observed_at":"2026-08-07T04:32:28.501651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16212","last_updated":"2025-05-24T20:25:08Z","snapshot_observed_at":"2026-08-07T15:03:09.725241Z","submitted_at":"2025-05-22T04:28:02Z","title":"Large Language Models based ASR Error Correction for Child Conversations","version":2},"cited_work":{"arxiv_id":"2505.16212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16212","snapshot_observed_at":"2026-08-07T04:32:31.069705Z","title":"Large Language Models based ASR Error Correction for Child Conversations","venue":"cs.CL","work_id":"f4a4f33e-6a13-4e52-b182-fc485951b593","year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.582864Z"},"links":{"cited_paper":"/paper/2505.16212","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:7798e5af4c047c7cd933ad6cc2dfd4081ac70c82bce784b2cc379f8a2c397422","observation_id":"037f3b84-3a70-477b-82b3-41105d6fdbd0","resolution":{"observed_at":"2026-08-07T04:32:31.149009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.171302Z","title":"Whislu: End-to-end spoken language under- standing with whisper,","venue":null,"work_id":"f77097e1-544e-4f61-a0c3-bdbdabf2f7b5","year":2023},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.696382Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:bbd34d8bb6d5454ba29f3b9f8bb4753070faef940e054c4b2bebe325d70dab5d","observation_id":"c398d687-7946-4a49-88de-b288647c4b63","resolution":{"observed_at":"2026-08-07T04:32:32.174849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:28.862742Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.862742Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:c94fb2a1ce40a219064b8bb64d0d9c7ea9464e8340843251869007b8e14bc3c9","observation_id":"1590c83d-fced-4424-82f2-2587dd72ea34","resolution":{"observed_at":"2026-08-07T04:32:28.862742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.155247Z","title":"Directional speech recognition for speaker disambiguation and cross- talk suppression,","venue":null,"work_id":"aab62a4d-2fa0-476d-ba16-d26adb66c64e","year":2023},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:28.959051Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:abc012808a5b627ed81520cd0b7556fcffa155c387b63137cae7d04709dcb979","observation_id":"dd031743-beb8-4c7e-ae96-72d9ab3117c5","resolution":{"observed_at":"2026-08-07T04:32:32.158696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.145072Z","title":"Agadir: Towards array-geometry agnostic directional speech recognition,","venue":null,"work_id":"37ea0dfb-d1f9-45fe-80b4-d66cf0ee342f","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.137476Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:1272fff17cb08f14d15d5974e609b14669ef4360bc9abb962fb9656b5f273a79","observation_id":"f85097fe-00ee-45bf-aa30-c361fc1584e9","resolution":{"observed_at":"2026-08-07T04:32:32.148804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.135096Z","title":"Directional source separation for robust speech recognition on smart glasses,","venue":null,"work_id":"27a9d21d-ee49-4741-a9a2-ea20ed9d2777","year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.257872Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:b9345a1512561c6f5035e108027b269607ac43b38d6b49b65b769a35dc99f17c","observation_id":"a856c219-40db-438d-b3ae-ed6df1be813d","resolution":{"observed_at":"2026-08-07T04:32:32.138485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00842","last_updated":"2022-07-14T20:40:04Z","snapshot_observed_at":"2026-08-04T03:36:16.585839Z","submitted_at":"2022-02-02T01:27:21Z","title":"Streaming Multi-Talker ASR with Token-Level Serialized Output Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00842","snapshot_observed_at":"2026-08-07T04:32:29.388286Z","title":"Streaming multi-talker asr with token-level serialized output training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.388286Z"},"links":{"cited_paper":"/paper/2202.00842","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:e94848f0db1aa3f30766995291279fa6521fc0361cef3dd01f19ed41482bbfdc","observation_id":"09ba88e8-626d-4d8d-8e53-1a54f04deab1","resolution":{"observed_at":"2026-08-07T04:32:29.388286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:32.121043Z","title":"Bertraffic: Bert-based joint speaker role and speaker change detection for air traffic control com- munications,","venue":null,"work_id":"f2b927f9-6817-46c7-919d-5a1ae40011ae","year":2022},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.500842Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:e4fed8b46b93a3940a77af1684f8ac9418485511497a9a74ee22cd8976179aca","observation_id":"e8f2ff60-b511-4cd0-b851-ba330a7c4caa","resolution":{"observed_at":"2026-08-07T04:32:32.126102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:29.676078Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.676078Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:3f2b5af383f4a13c24b6911ac63cb22ee0bb0f404012b31eda9e8bfea94983f9","observation_id":"22877d80-cfea-492a-94bf-01c534ad243c","resolution":{"observed_at":"2026-08-07T04:32:29.676078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.09972","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:30.939100Z","title":"Who said what wsw 2.0? enhanced automated analysis of preschool classroom speech,","venue":null,"work_id":"685507f8-dd6e-4f22-b0d9-630192efa0fc","year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.756704Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:683d01d5674ca8cdba819d60cbf2bb9f32ba8813a2cfc83bd7e12d49dbb8cb00","observation_id":"10c32fc3-2a65-47b7-ba7d-e6d474f1b1c4","resolution":{"observed_at":"2026-08-07T04:32:31.012212Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:29.844757Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.844757Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:71ca3465c1175db11c14ed7a0a74a3b3fffe2e43a1b1f536b70c6d73834b0c5b","observation_id":"4d38ee8c-7cfe-404d-86ed-04b746ea24ed","resolution":{"observed_at":"2026-08-07T04:32:29.844757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.946941Z","title":"Exploring speech foundation models for speaker diariza- tion in child-adult dyadic interactions,","venue":null,"work_id":"fc2f4bd1-eefd-4a7a-a8b2-0be41a5ae56a","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:29.972442Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:442c61ce110ab2d4733b04175f5458a0f62bcbd62b3a95ac6b5a883c1fad7a37","observation_id":"4b44b5da-5781-4bf6-a0fe-b697476cb03e","resolution":{"observed_at":"2026-08-07T04:32:32.023994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.751451Z","title":"Data efficient child-adult speaker diarization with simulated conversations,","venue":null,"work_id":"5122f623-33a1-400b-a86e-610db4d0ec4e","year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.007711Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:147d33fe9bef5d93d0dbcc1a668a0727de5f77f3d14ed475dcf6f6d716897360","observation_id":"a6e47252-1fb9-4101-80f5-121cfbd47230","resolution":{"observed_at":"2026-08-07T04:32:31.877891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14648","last_updated":"2025-05-20T17:36:41Z","snapshot_observed_at":"2026-08-07T15:28:11.502429Z","submitted_at":"2025-05-20T17:36:41Z","title":"Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14648","snapshot_observed_at":"2026-08-07T04:32:30.081659Z","title":"V ox-profile: A speech foundation model benchmark for characterizing diverse speaker and speech traits,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.081659Z"},"links":{"cited_paper":"/paper/2505.14648","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:a8cce05cbf28df8b4c3ab4ae485e5fbde7f52a1e0024bbe38056c7477bd70528","observation_id":"65de492a-1c5c-4f55-874d-43f4866d19d2","resolution":{"observed_at":"2026-08-07T04:32:30.081659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.524753Z","title":"The chime-8 mmcsg chal- lenge: Multi-modal conversations in smart glasses,","venue":null,"work_id":"fcc1d6bf-15ec-4bb8-b0b5-ee0344067f35","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.179128Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:564b98cadc84519946c99049314e80d371337c365478bc4b033fb23bd0ae0478","observation_id":"74354199-cc9d-4234-8519-b698d0098208","resolution":{"observed_at":"2026-08-07T04:32:31.637652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-07T04:32:30.227311Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.227311Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:3c9aa87d0216402a65a203bfd25570ad7811ce3f3e677bae1b9303a8b86f4d11","observation_id":"97d95895-7355-4b31-83b6-d50e6d76d3c4","resolution":{"observed_at":"2026-08-07T04:32:30.227311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:30.318273Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.318273Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:7fd05b4a1549724581b04655b13879a94a7c1470e44279beb0bc384c28546398","observation_id":"d2271d5a-ea78-494c-9b26-a5c82d23040f","resolution":{"observed_at":"2026-08-07T04:32:30.318273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T04:32:30.437423Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.437423Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:d75041a61fde56d15e0115b912148511b5623e40170aa5ed8d5abad5bc7dacd7","observation_id":"d8de2a0e-6168-4d88-ab94-a6a625aaacae","resolution":{"observed_at":"2026-08-07T04:32:30.437423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.359753Z","title":"Playlogue: Dataset and benchmarks for analyzing adult- child conversations during play,","venue":null,"work_id":"b9ef463a-70f5-4098-a0e7-fba0b2e16564","year":2024},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.521621Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:9df3ab302064515ddfc46f70bc56b7d9b392bef6026d92ddaa5fbd2523f55339","observation_id":"353ba2e7-ac54-4706-b7d4-d03b74d90228","resolution":{"observed_at":"2026-08-07T04:32:31.412456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:32:31.187707Z","title":"The talkbank project,","venue":null,"work_id":"70a11840-86fe-4f71-a17b-00ec3b69239c","year":2007},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.571547Z"},"links":{"citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:2af673fd3daaed3c8b1bb526a1b53d4813e39cd7bfb481cf82d062a76cf6bc7e","observation_id":"5ddb2afe-44ea-4564-848f-49f535c1b8ef","resolution":{"observed_at":"2026-08-07T04:32:31.273720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.09577","last_updated":"2019-09-14T03:51:46Z","snapshot_observed_at":"2026-08-03T18:17:55.398298Z","submitted_at":"2019-09-14T03:51:46Z","title":"NeMo: a toolkit for building AI applications using Neural Modules","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.09577","snapshot_observed_at":"2026-08-07T04:32:30.682646Z","title":"Nemo: a toolkit for building ai applications using neural modules,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.682646Z"},"links":{"cited_paper":"/paper/1909.09577","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:d7733caa5c28b62c8fc9c8d5d42ff5549e8e8c4b4efc1ce4ef4dd4b05e88efdc","observation_id":"3c41ea32-f349-4914-95bf-a58fa6aec58b","resolution":{"observed_at":"2026-08-07T04:32:30.682646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-07T04:32:30.776033Z","title":"Huggingface’s trans- formers: State-of-the-art natural language processing,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:32:30.776033Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2506.10349"},"observation_digest":"sha256:a8294b43b915812fda168ea2de719a7aff82b7eed64004ca5188eac1b11b3c45","observation_id":"455c2cf4-d61f-4173-84a1-f0b760fedc38","resolution":{"observed_at":"2026-08-07T04:32:30.776033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10349","last_updated":"2025-06-12T05:04:53Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T01:37:13.414267Z","submitted_at":"2025-06-12T05:04:53Z","title":"Joint ASR and Speaker Role Tagging with Serialized Output Training"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2506.10349."}