{"as_of":"2026-08-09T13:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c93e6028518ff121dfe8ea89aa7c06b69390c0eef7950c5de56ddcf0652d423","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:50:17.272359Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:50:17.073394Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:50:17.584368Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.12672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12672","snapshot_observed_at":"2026-08-07T00:50:17.584368Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","venue":"cs.SD","work_id":"ba7ade5b-745d-446e-bc22-1d1155b36d89","year":2025},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.073394Z"},"links":{"cited_paper":"/paper/2506.12672","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:4013a85743b327d4fe6d4bdd03f2167b6319f7d6cec0ed6fd6d8daba5ab33364","observation_id":"1ad7751f-54f4-4b45-964d-2f03033599d5","resolution":{"observed_at":"2026-08-07T00:50:17.589525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12672/citation-record","integrity":"/paper/2506.12672/integrity","json":"/paper/2506.12672/citation-record.json","paper":"/paper/2506.12672"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"cited_work":{"arxiv_id":"2506.12672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12672","snapshot_observed_at":"2026-08-07T00:50:17.584368Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","venue":"cs.SD","work_id":"ba7ade5b-745d-446e-bc22-1d1155b36d89","year":2025},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.073394Z"},"links":{"cited_paper":"/paper/2506.12672","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:4013a85743b327d4fe6d4bdd03f2167b6319f7d6cec0ed6fd6d8daba5ab33364","observation_id":"1ad7751f-54f4-4b45-964d-2f03033599d5","resolution":{"observed_at":"2026-08-07T00:50:17.589525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.936085Z","title":null,"venue":null,"work_id":"df6353fd-289c-4c3c-a31c-5dcfc3e7ec52","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.078666Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:212f63d27875f2d5d956151da6289c653de1d3ba1ac1e0b0801064a11bf9d622","observation_id":"405de8c9-4626-4240-a43a-a36fe2cf999c","resolution":{"observed_at":"2026-08-07T00:50:17.942252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.919648Z","title":null,"venue":null,"work_id":"0078c70c-1b85-4029-b52b-7e33ede7b2f6","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.083516Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:ef25591a00cd145c8a843413ac7d3421d881b520229e1b5941812b96884a04d7","observation_id":"cb0e5e3b-925e-4fc2-b02a-54fdf9ad3b7b","resolution":{"observed_at":"2026-08-07T00:50:17.924431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.903931Z","title":"Dataset The training set consists of LibriSpeech-360h [27], Libri2Mix, and Libri3Mix [28]","venue":null,"work_id":"f9200c75-bc3b-4a3a-9147-cf2413fcca71","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.088616Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:cc637c3f7235ebb2a6437a7c880d359ac3a1ffce90ca487c1a2c1bf8daf3b1c1","observation_id":"7807dc91-3110-48ba-93a3-5fe6d82d29ee","resolution":{"observed_at":"2026-08-07T00:50:17.909059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.871225Z","title":"Our proposed SC-SOT models, particularly when combined with multi-task learning (MTL), demonstrate promis- ing performance gains over the conventional SOT-based model","venue":null,"work_id":"ce5329b7-4617-44d7-a022-a8e59419fea0","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.099198Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:4b538e81030819271bce60983222098bb55cf54ec13bf19a46c95a2cbf97a820","observation_id":"119c431a-5298-420b-bf3a-0621ff9ce989","resolution":{"observed_at":"2026-08-07T00:50:17.876339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.854598Z","title":"Our initial analy- sis, through visualization of source-target attention weights in an SOT-based model, revealed that the decoder performs a de- gree of speaker separation","venue":null,"work_id":"40813ae9-ba10-418f-83a6-40d0782f86b2","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.104148Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:c3ff25e78916e31887d20bdc53fe8ca298a96e188c9eb158af4c141ef563ae1e","observation_id":"be4c3326-ae81-42a4-97e6-6d78eb03ccf4","resolution":{"observed_at":"2026-08-07T00:50:17.859960Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.110271Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.110271Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:d8bd42c1241c50f80567f52181bc972818cc1db80e9869e531da14ab143e9ed2","observation_id":"f73ff6b2-0cf5-4938-bc88-b1d7c2627bd6","resolution":{"observed_at":"2026-08-07T00:50:17.110271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.795488Z","title":"Sequence to multi-sequence learning via conditional chain mapping for mixture signals,","venue":null,"work_id":"4e41f584-71ba-46ba-b0e5-5546ac9263bb","year":2020},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.151926Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:aeb561d45a783ef7cb8cfe5a3fd9efa947d7fea54ff2ad0ce57449a3fcc0a8ab","observation_id":"4af809b9-9acb-46bb-8a38-6b1edd2a03d4","resolution":{"observed_at":"2026-08-07T00:50:17.800507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.115011Z","title":"Recent advances in end-to-end automatic speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.115011Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:b74e6ec24033488778e39a5835e8d29bb3a668a5e1e16e0b4c8c9e21041b8b6a","observation_id":"8814306e-e349-45ff-9567-2150e2b26cc3","resolution":{"observed_at":"2026-08-07T00:50:17.115011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.820339Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":"6345266c-0983-4a8b-bd66-dd72d8a8968e","year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.120316Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:af354004241ddf7d515cd21c3dca171af45e94f510351851fb7146b5375d00b0","observation_id":"f515b9f0-5c58-44cc-9342-61b398a66887","resolution":{"observed_at":"2026-08-07T00:50:17.824737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.125516Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.125516Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:446a9bcbe3d40678f1bb2db6a19ff87f285eee714e9b6016dd5f40e8c56a3be9","observation_id":"951bc0d5-095d-4279-ae7a-28ca126fdbea","resolution":{"observed_at":"2026-08-07T00:50:17.125516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09841","last_updated":"2024-04-16T14:55:13Z","snapshot_observed_at":"2026-08-02T02:02:01.128117Z","submitted_at":"2024-04-15T14:48:43Z","title":"Anatomy of Industrial Scale Multilingual ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09841","snapshot_observed_at":"2026-08-07T00:50:17.130311Z","title":"Anatomy of industrial scale multilingual asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.130311Z"},"links":{"cited_paper":"/paper/2404.09841","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:0f34c80b7c088cbd89d825d944965eac5d47d30c1997a3e968711bbfd54d9f4f","observation_id":"a4ed4b4e-fe46-4103-a45f-71342bddb5d0","resolution":{"observed_at":"2026-08-07T00:50:17.130311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19674","last_updated":"2024-06-28T06:22:23Z","snapshot_observed_at":"2026-07-06T18:38:18.115901Z","submitted_at":"2024-06-28T06:22:23Z","title":"Less is More: Accurate Speech Recognition & Translation without Web-Scale Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19674","snapshot_observed_at":"2026-08-07T00:50:17.135316Z","title":"Less is more: Accurate speech recog- nition & translation without web-scale data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.135316Z"},"links":{"cited_paper":"/paper/2406.19674","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:1ce5dd0983dedd6544c5e3b51e943c97489f6f833fb87325b3355dbffcf48286","observation_id":"86e970ca-86a7-4fdb-8db1-89a9f125a60d","resolution":{"observed_at":"2026-08-07T00:50:17.135316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.01985","last_updated":"2017-06-19T10:57:38Z","snapshot_observed_at":"2026-08-02T09:02:30.805597Z","submitted_at":"2017-03-22T08:39:32Z","title":"Recognizing Multi-talker Speech with Permutation Invariant Training","version":4},"cited_work":{"arxiv_id":"1704.01985","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.01985","snapshot_observed_at":"2026-08-07T00:50:17.524428Z","title":"Recognizing Multi-talker Speech with Permutation Invariant Training","venue":"cs.SD","work_id":"aebb5294-78a6-42ea-9c92-b7348ee5cbf1","year":2017},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.141353Z"},"links":{"cited_paper":"/paper/1704.01985","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:f76682798f93c64d50b09f2578b03d31009309449cc9c0e22f21e21e3f0669af","observation_id":"ed548814-085e-400f-9406-86d11342b4be","resolution":{"observed_at":"2026-08-07T00:50:17.529996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.12687","last_updated":"2020-08-08T20:08:37Z","snapshot_observed_at":"2026-08-04T07:16:40.156853Z","submitted_at":"2020-03-28T02:37:09Z","title":"Serialized Output Training for End-to-End Overlapped Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.12687","snapshot_observed_at":"2026-08-07T00:50:17.146989Z","title":"Seri- alized output training for end-to-end overlapped speech recogni- tion,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.146989Z"},"links":{"cited_paper":"/paper/2003.12687","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:ed9b7ca18d66566cdc1832c063a615f4a44b5dbf7dacff41fb292f9c3861cea4","observation_id":"d14078c9-7074-4944-a84a-b28828a3ee89","resolution":{"observed_at":"2026-08-07T00:50:17.146989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.722718Z","title":"Speakerbeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"dcfcd4fe-60d1-4433-8c1b-031911e8b6b6","year":2019},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.191684Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:6210eb764f1590a2f571013ae8255dd550c7d77d1ef8ab5673f35be45950fcd7","observation_id":"ba27bf0b-135b-4fbe-bee4-cf7f94d8c084","resolution":{"observed_at":"2026-08-07T00:50:17.727622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00842","last_updated":"2022-07-14T20:40:04Z","snapshot_observed_at":"2026-08-04T03:36:16.585839Z","submitted_at":"2022-02-02T01:27:21Z","title":"Streaming Multi-Talker ASR with Token-Level Serialized Output Training","version":5},"cited_work":{"arxiv_id":"2202.00842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.00842","snapshot_observed_at":"2026-08-07T00:50:17.484102Z","title":"Streaming Multi-Talker ASR with Token-Level Serialized Output Training","venue":"eess.AS","work_id":"9789dd90-d13b-4312-92e2-478bc726c11a","year":2022},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.156569Z"},"links":{"cited_paper":"/paper/2202.00842","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:2e506aa2652fc35daf59feb58e908b407678a4ea9156011b7096e8c92a1a6ae8","observation_id":"4ba06cd0-8d43-483b-b401-36c1d57ef1ef","resolution":{"observed_at":"2026-08-07T00:50:17.490013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.779196Z","title":"Surt 2.0: Advances in transducer-based multi-talker speech recognition,","venue":null,"work_id":"70a0a553-80a8-4c61-87ea-5fd6c617b963","year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.161468Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:cd60d2585a91d8e55dea2b4daba15e3389d7423465eee921355f0759dcfb6f32","observation_id":"4376e618-bfce-4786-8f37-1467ab96e3f7","resolution":{"observed_at":"2026-08-07T00:50:17.784366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.763648Z","title":"Permutation invari- ant training of deep models for speaker-independent multi-talker speech separation,","venue":null,"work_id":"9cd90f84-5e2b-439c-a736-1559d020fbd1","year":2017},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.166023Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:6e541738ca2e13a2560207dfded6d1e5fb0c9776f369d5fc7747aaee91c873d1","observation_id":"d553db92-cce3-4a02-8e06-0f4d2aa68ca7","resolution":{"observed_at":"2026-08-07T00:50:17.768604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.05826","last_updated":"2018-05-15T14:45:33Z","snapshot_observed_at":"2026-07-06T06:39:15.823836Z","submitted_at":"2018-05-15T14:45:33Z","title":"A Purely End-to-end System for Multi-speaker Speech Recognition","version":1},"cited_work":{"arxiv_id":"1805.05826","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.05826","snapshot_observed_at":"2026-08-07T00:50:17.459260Z","title":"A Purely End-to-end System for Multi-speaker Speech Recognition","venue":"cs.SD","work_id":"1a63c333-f7fb-4a35-8f4b-b46019b454ba","year":2018},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.170341Z"},"links":{"cited_paper":"/paper/1805.05826","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:8788212e84f2248dc74208db567766a1fdea513623a5fad28076f13b2d6f098c","observation_id":"2952a336-5482-45c4-bda7-03457cb27a32","resolution":{"observed_at":"2026-08-07T00:50:17.464512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.747473Z","title":"Mimo-speech: End-to-end multi-channel multi-speaker speech recognition,","venue":null,"work_id":"1af89bf3-a4ef-4bde-bf96-be8defb4deed","year":2019},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.176328Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:056b6f68556386cbdc1fbb5eaed6cecc6c00fe6b3520281fff29251208dfb181","observation_id":"ecf7c578-90f1-41d9-8383-166d59ebc84f","resolution":{"observed_at":"2026-08-07T00:50:17.752648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09921","last_updated":"2020-10-05T07:12:42Z","snapshot_observed_at":"2026-07-06T09:21:53.517585Z","submitted_at":"2020-05-20T09:08:41Z","title":"End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based Attractors","version":3},"cited_work":{"arxiv_id":"2005.09921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.09921","snapshot_observed_at":"2026-08-07T00:50:17.438413Z","title":"End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based Attractors","venue":"eess.AS","work_id":"c7bc827b-c940-45f3-87bd-4f6c0f1bb8f7","year":2020},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.181573Z"},"links":{"cited_paper":"/paper/2005.09921","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:6d1cf1ff902362ad507a8ab9f184b4242b6d9d5c6bdc0b4e5793f27d41b6f030","observation_id":"e6c902b3-0659-48a7-a629-effaa25cc403","resolution":{"observed_at":"2026-08-07T00:50:17.443388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.186901Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.186901Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:5c0b2bdeecee700e2facfb46352e0ca39f47f4e5e89117b4988f98767c795cec","observation_id":"4017e837-3f20-4e2f-bc3e-58ec3e399815","resolution":{"observed_at":"2026-08-07T00:50:17.186901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.651466Z","title":"Transcribe-to-diarize: Neural speaker diariza- tion for unlimited number of speakers using end-to-end speaker- attributed asr,","venue":null,"work_id":"3f152a0c-84a2-42db-afa2-90bc179cc93d","year":2022},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.232416Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:a44992e707d32c6621f92784b1f14f9b30537faa7861f7fa47878f7311b45909","observation_id":"380de5a2-eb45-4886-8511-bc397d5cc1be","resolution":{"observed_at":"2026-08-07T00:50:17.657506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.706343Z","title":"Adaptive blind audio source extraction supervised by dominant speaker identification using x-vectors,","venue":null,"work_id":"2667274e-feda-4eaf-b6d8-300ff0557b0b","year":2020},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.196306Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:cd6eef0753c87185db5d382584713f94dbed28e4edd538e509d11d433bdbebc6","observation_id":"3c19fef3-ff92-49fa-a295-6b1fcd445f7a","resolution":{"observed_at":"2026-08-07T00:50:17.711415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07272","last_updated":"2020-07-27T13:28:20Z","snapshot_observed_at":"2026-08-09T04:17:58.255052Z","submitted_at":"2020-05-14T21:24:56Z","title":"Target-Speaker Voice Activity Detection: a Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario","version":2},"cited_work":{"arxiv_id":"2005.07272","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.07272","snapshot_observed_at":"2026-08-07T00:50:17.416959Z","title":"Target-Speaker Voice Activity Detection: a Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario","venue":"eess.AS","work_id":"19e30c97-5fcf-47e8-a912-f780b52dc106","year":2020},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.200864Z"},"links":{"cited_paper":"/paper/2005.07272","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:abab03040862a02219d8bc81432dee11b1a023a4b04060704f53217aacfea9c8","observation_id":"60b19474-c3ea-4af3-92ef-e7ba9ad5b911","resolution":{"observed_at":"2026-08-07T00:50:17.422697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.691535Z","title":"Tar- get speaker voice activity detection with transformers and its in- tegration with end-to-end neural diarization,","venue":null,"work_id":"488e5c41-bc37-4e2c-a4c2-b0d9782ab8ce","year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.206891Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:4411926761f053f05c24eaf3c31bb0dd6dd58337ab3ae985896ab19022b208e0","observation_id":"866845d2-be7c-46f1-ad3c-b8423cd743d0","resolution":{"observed_at":"2026-08-07T00:50:17.696412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.677212Z","title":"Adapting self-supervised models to multi-talker speech recognition using speaker embeddings,","venue":null,"work_id":"c3dd9be7-35b4-49ea-a80f-982f153f0040","year":2023},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.211578Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:15aae46d030bd41ec35fe7be6ba0ad8e13d7822af5ec920bc0209c6eadddb9fc","observation_id":"7715e151-8ace-474f-a08c-23f071d90dab","resolution":{"observed_at":"2026-08-07T00:50:17.682041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.887162Z","title":"The Conformer encoder has 12 layers, while the Transformer decoder is structured with 6 layers","venue":null,"work_id":"eb50b547-cc40-41ff-b8fe-ffef55d1f1c1","year":null},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.093997Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:6137610582dfe7973295cf31cdc5c59c1d1e4519e124af5360042ec193f4c5ff","observation_id":"35cb56ab-2885-4e35-916f-a01a5f63ea7d","resolution":{"observed_at":"2026-08-07T00:50:17.892600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.216547Z","title":"Con- nectionist temporal classification: labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.216547Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:76032a7309491b6e2590b0626c79b0d492a8e9136330eba6fc4a68b805c23e5b","observation_id":"09c22c77-82f4-48cd-a98f-8a49be71a03b","resolution":{"observed_at":"2026-08-07T00:50:17.216547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09543","last_updated":"2025-01-16T09:51:19Z","snapshot_observed_at":"2026-07-06T19:15:29.988880Z","submitted_at":"2024-09-14T21:46:00Z","title":"Target Speaker ASR with Whisper","version":2},"cited_work":{"arxiv_id":"2409.09543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09543","snapshot_observed_at":"2026-08-07T00:50:17.391298Z","title":"Target Speaker ASR with Whisper","venue":"eess.AS","work_id":"cd166029-8b76-4763-ba6b-2c08b9d9d66e","year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.222508Z"},"links":{"cited_paper":"/paper/2409.09543","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:a531a8551dac68f111658b40f0b466a31a2c67ff1d4322b45cdd65c4b46baa7b","observation_id":"1154dfe7-8571-4985-8f49-c0b593f47eeb","resolution":{"observed_at":"2026-08-07T00:50:17.399004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-07T00:50:17.227570Z","title":"Di- cow: Diarization-conditioned whisper for target speaker au- tomatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.227570Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:4a297951eea4e42b4c95663a1860f6e0fb42ba6c5ed74241a874b204ce351389","observation_id":"33eeac7b-ef79-4c00-9143-2aa993c6071f","resolution":{"observed_at":"2026-08-07T00:50:17.227570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.635222Z","title":"But/jhu system descrip- tion for chime-8 notsofar-1 challenge,","venue":null,"work_id":"d2c0c357-8684-4b72-b93f-fcb76d3220a0","year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.237094Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:2e7ad26c38d608566509c4a5ed5163e085eb97896f3f43dabea7faa33c33ec8a","observation_id":"61ec0b16-5040-4d03-b1d6-95f7c08db808","resolution":{"observed_at":"2026-08-07T00:50:17.640268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00015","last_updated":"2018-03-30T18:09:39Z","snapshot_observed_at":"2026-07-06T06:31:07.605442Z","submitted_at":"2018-03-30T18:09:39Z","title":"ESPnet: End-to-End Speech Processing Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.00015","snapshot_observed_at":"2026-08-07T00:50:17.242039Z","title":"Espnet: End-to-end speech processing toolkit,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.242039Z"},"links":{"cited_paper":"/paper/1804.00015","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:74fe473aa62b52459ab27c322d77057140509c6cc16f8225594a275ebf91c300","observation_id":"068f07fe-08e1-42f7-8d45-08c3a86ec4d0","resolution":{"observed_at":"2026-08-07T00:50:17.242039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.620692Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"4628a7fb-4ac9-473b-b4f4-83c3c6611433","year":2015},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.246975Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:c51c3488a9e01b52f77b8542ab41579c00a26eb4c4e2eb7911577967c874b988","observation_id":"4ddde7f5-7f1b-4edd-a0be-6f94237742de","resolution":{"observed_at":"2026-08-07T00:50:17.625398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T00:50:17.251656Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.251656Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:517667c22d6cc87babe10d9e883e86008a6184110094dc913ebf468271f40f3a","observation_id":"0123293d-e901-4c82-8787-7cce00d2debe","resolution":{"observed_at":"2026-08-07T00:50:17.251656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T00:50:17.256472Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.256472Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:8eb6e431a4a6fbf3f8ef0a228653c35ddc0d639004b61ed72d1a9d2e1224cc68","observation_id":"0fa73f01-3f40-4b90-a87c-e5527b34ac03","resolution":{"observed_at":"2026-08-07T00:50:17.256472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.262241Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.262241Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:a52ed28ae70cf2921af10414272883c06ee7b45d0231eda1b64fee3d7055bc5d","observation_id":"b39777e2-7e61-493e-9d59-8ffc4ff45661","resolution":{"observed_at":"2026-08-07T00:50:17.262241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:50:17.267393Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.267393Z"},"links":{"citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:e34a7ea60def5714f36e88a6e335f563af5d8ed2b205f600e0da201b7be3f0bd","observation_id":"38baa58f-d614-4712-8dd3-d8bce09ac4e2","resolution":{"observed_at":"2026-08-07T00:50:17.267393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T00:50:17.272359Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.272359Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:0096e851bf3b2b48c4fb569eff46243e889e66fd02b5a7bb75946607f994eeae","observation_id":"63a2af0e-2c8b-4091-8761-28d663944392","resolution":{"observed_at":"2026-08-07T00:50:17.272359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T02:34:55.689465Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":7,"verified_fuzzy":15},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2506.12672."}