{"as_of":"2026-08-15T19:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b8c39cfb3b652a83d029d7c83b481f0f641aae2d7ba62c1e3cf588ac91ad2db","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:18:52.399445Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:58:01.482455Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T07:57:44.681677Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05796","snapshot_observed_at":"2026-08-06T17:58:01.482455Z","title":"Diarization-aware multi-speaker automatic speech recognition via large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09499","last_updated":"2025-07-13T05:30:39Z","snapshot_observed_at":"2026-08-11T19:38:47.337631Z","submitted_at":"2025-07-13T05:30:39Z","title":"The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:01.482455Z"},"links":{"cited_paper":"/paper/2506.05796","citing_paper":"/paper/2507.09499"},"observation_digest":"sha256:179e0e75248eb3f892bace3deedd218e77f8073a971208fb37a630b513656032","observation_id":"3f3f5baf-da44-4948-8150-38964a23088a","resolution":{"observed_at":"2026-08-06T17:58:01.482455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05796","snapshot_observed_at":"2026-08-03T11:20:26.130555Z","title":"InICASSP 2021-2021 IEEE International Confer- ence on Acoustics, Speech and Signal Processing (ICASSP), pages 7198–7202","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.06896","last_updated":"2026-07-13T07:08:04Z","snapshot_observed_at":"2026-08-13T20:36:52.042652Z","submitted_at":"2026-01-11T12:40:07Z","title":"TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T11:20:26.130555Z"},"links":{"cited_paper":"/paper/2506.05796","citing_paper":"/paper/2601.06896"},"observation_digest":"sha256:a687e85b89c53c3de7d195d8ee3171d95ba76346997d96e8646f93ca5e993131","observation_id":"4674cee3-c33d-4994-8c22-d0b1951e15b1","resolution":{"observed_at":"2026-08-03T11:20:26.130555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.05796","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05796","snapshot_observed_at":"2026-07-03T07:57:44.681677Z","title":"Diarization-aware multi-speaker automatic speech recognition via large language models,","venue":null,"work_id":"6d83eae1-3662-4804-96c8-8ec828090b05","year":2025},"citing_paper":{"arxiv_id":"2604.22467","last_updated":"2026-04-24T11:43:25Z","snapshot_observed_at":"2026-08-12T03:43:07.184751Z","submitted_at":"2026-04-24T11:43:25Z","title":"DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T09:18:53.285951Z"},"links":{"cited_paper":"/paper/2506.05796","citing_paper":"/paper/2604.22467"},"observation_digest":"sha256:7623e0022bd1dd556c9773a0f35290a788cb48da39c210a387469e124aa33960","observation_id":"7979bb9f-f26c-4b78-8e4e-1a2604944a82","resolution":{"observed_at":"2026-05-11T20:21:12.609984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.05796","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05796","snapshot_observed_at":"2026-07-03T07:57:44.681677Z","title":"Diarization-aware multi-speaker automatic speech recognition via large language models,","venue":null,"work_id":"6d83eae1-3662-4804-96c8-8ec828090b05","year":2025},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-08-11T22:22:00.146637Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"cited_paper":"/paper/2506.05796","citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:b867ebcbec7d522828f5a7d2d20822d84d757e9f6c0933cc1118cc4ec84f26f3","observation_id":"491b754c-fb6f-4348-9336-9153c19c506a","resolution":{"observed_at":"2026-07-03T07:57:44.683338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05796/citation-record","integrity":"/paper/2506.05796/integrity","json":"/paper/2506.05796/citation-record.json","paper":"/paper/2506.05796"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:46.284510Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:46.284510Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:98f2f80d5c68dad0f14066347b3659878476557f6ea618be57d94c5582893ab0","observation_id":"ddc2f27e-3a79-40e5-93ee-b2219d301ab9","resolution":{"observed_at":"2026-08-07T10:18:46.284510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.659747Z","title":"Recent advances in end-to-end automatic speech recog- nition,","venue":null,"work_id":"195394e4-7dc0-4072-ac6d-d45ba5bc9ccd","year":2022},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:46.436866Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:7074ad3abd5da1f58871a3ba24959ea37a0abbd617c9a80516e361161efac2bb","observation_id":"125cf6a5-a89a-406e-b5ec-1b49d37b145a","resolution":{"observed_at":"2026-08-07T10:19:00.755249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:46.610670Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:46.610670Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:93ffcf26435c0c73b1d9d9fd9cf12c3f8ad1e020382b08a5cef1a55cbc38cf2f","observation_id":"96fd517d-f861-4492-a9aa-5214cec1df15","resolution":{"observed_at":"2026-08-07T10:18:46.610670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10975","last_updated":"2026-05-27T20:17:05Z","snapshot_observed_at":"2026-08-07T15:44:48.094914Z","submitted_at":"2025-05-16T08:21:59Z","title":"Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10975","snapshot_observed_at":"2026-08-07T10:18:46.748745Z","title":"Survey of end-to-end multi-speaker au- tomatic speech recognition for monaural audio,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:46.748745Z"},"links":{"cited_paper":"/paper/2505.10975","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:98faa0c7a4c003c12394a77b6c1ffdec359ff64d89287c55fc65cf0f7753afe0","observation_id":"6a6e33d5-330d-49d2-8c46-e186c547be93","resolution":{"observed_at":"2026-08-07T10:18:46.748745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13734","last_updated":"2023-07-14T09:45:21Z","snapshot_observed_at":"2026-08-13T11:10:25.206671Z","submitted_at":"2023-06-23T18:49:20Z","title":"The CHiME-7 DASR Challenge: Distant Meeting Transcription with Multiple Devices in Diverse Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13734","snapshot_observed_at":"2026-08-07T10:18:46.930479Z","title":"The chime-7 dasr challenge: Distant meeting transcription with multiple devices in diverse scenarios,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:46.930479Z"},"links":{"cited_paper":"/paper/2306.13734","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:0240f4dbdeef06689153f34a6bcdcd9aa0e7f73a8a9442b1240da744e7cad4f7","observation_id":"e719cc1b-7012-42c1-a3f9-2aa26fcf4324","resolution":{"observed_at":"2026-08-07T10:18:46.930479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12378","last_updated":"2023-10-18T23:10:46Z","snapshot_observed_at":"2026-08-13T05:45:48.745235Z","submitted_at":"2023-10-18T23:10:46Z","title":"The CHiME-7 Challenge: System Description and Performance of NeMo Team's DASR System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12378","snapshot_observed_at":"2026-08-07T10:18:47.093900Z","title":"The chime-7 challenge: System description and performance of nemo team’s dasr system,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:47.093900Z"},"links":{"cited_paper":"/paper/2310.12378","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:f1bdc4b80b8bfa813e0c9c82f3d331fe3999469f623aa3d438803ee24a38de30","observation_id":"fce4c73c-2739-4fc4-9714-7aa4dd7007d3","resolution":{"observed_at":"2026-08-07T10:18:47.093900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.326825Z","title":"The iacas- thinkit system for chime-7 challenge,","venue":null,"work_id":"695bf5ba-16b9-4879-a143-e6a39adb67ab","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:47.212304Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:d470593f57d201a9a0f55bcbc3ac6c148ff8b84d0d50925908d4e4bdffe16811","observation_id":"ae635742-d518-43ee-a32b-485d18629f94","resolution":{"observed_at":"2026-08-07T10:19:00.491328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.036179Z","title":"Lexical speaker error correction: Leveraging language models for speaker diarization error correction,","venue":null,"work_id":"5f17856b-879f-406b-970e-de5ba3d0bec1","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:47.378249Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:358e73f6f51e552d5f9723ce9ad7e32c7b66674d17ef40d4ed523c68b05accb7","observation_id":"40a396bd-63a8-44c3-a9f7-24276a5de59f","resolution":{"observed_at":"2026-08-07T10:19:00.174579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:59.592953Z","title":"Diariza- tionlm: Speaker diarization post-processing with large language models,","venue":null,"work_id":"1b5a8a6c-fbd4-4027-a98e-75337712e108","year":2024},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:47.577559Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:195bbe3ae9444344cd2e8f01c92a493715bb3195663b96dbc0cfe2c275c717bf","observation_id":"a30ada74-12b3-4e78-b54d-cb3ec0539a55","resolution":{"observed_at":"2026-08-07T10:18:59.813755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:59.248448Z","title":"Continuous speech separation with conformer,","venue":null,"work_id":"ac29ba54-f512-464a-8950-2eb4e4ba6e25","year":2021},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:47.692208Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:98b32c958e0264204249b32a7e803bc81cfdf06c83a77e3e290555345fb42f73","observation_id":"3d8c46d5-8615-439a-8c07-efb2f3278b04","resolution":{"observed_at":"2026-08-07T10:18:59.351172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:59.067842Z","title":"Low latency online blind source separation based on joint optimization with blind dereverberation,","venue":null,"work_id":"2405f074-1443-4441-aa01-0d8226c383eb","year":2021},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:47.874830Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:a9cab7286450f9dd1d07f75c8664b5bba52f22c01bc8aa0976ab9864752f4ab8","observation_id":"ead1c679-59bd-4bb8-8119-4c1a3580cbc7","resolution":{"observed_at":"2026-08-07T10:18:59.137794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.711766Z","title":"Gpu-accelerated guided source separation for meeting transcription,","venue":null,"work_id":"d8955172-078f-4929-98e3-88326a1f8d01","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:48.008644Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:c2d56981ec56dd592b678551a687152f4ef3c7811d584f39fbd5690a7e7860d0","observation_id":"2268b755-ca0c-49f0-af65-18373f325de5","resolution":{"observed_at":"2026-08-07T10:18:58.864495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.447064Z","title":"Recognizing multi-talker speech with permutation invariant training,","venue":null,"work_id":"7d7d3634-ed74-4964-945a-c00958bdfc49","year":2017},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:48.186953Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:91acd1c962ce9a2bc084eb0620138cb37b1386811e1c61994a34de482f03a28a","observation_id":"123df304-22b8-42da-b864-e69730549b57","resolution":{"observed_at":"2026-08-07T10:18:58.570712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.125106Z","title":"Mimo- speech: End-to-end multi-channel multi-speaker speech recognition,","venue":null,"work_id":"ddd52597-eeae-49ba-9cf0-dc52091b7e7e","year":2019},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:48.367081Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:4309164359c135c0bca877a703be2dda12bebe35573d85722aa41f43b89b5b36","observation_id":"33aff08b-c8ff-4a63-9447-ba9428149f9c","resolution":{"observed_at":"2026-08-07T10:18:58.298479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.832173Z","title":"Improving end-to- end single-channel multi-talker speech recognition,","venue":null,"work_id":"19355452-cbf0-454c-ae77-52ec05e21b8a","year":2020},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:48.523338Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:a52837ea909c181400ad73ba83bd5083d3aff995a9bc6fdb2590b64a0c325b6f","observation_id":"5b8a5bc0-0652-4e9d-a55f-546a11dd33ae","resolution":{"observed_at":"2026-08-07T10:18:57.994425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:48.656650Z","title":"Serialized output training for end-to-end overlapped speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:48.656650Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:23b29f73b8ab6c312f75b8548066f2d6ac3a3e00d0438f6c4fd7bef6e9ae09d7","observation_id":"1b2c1675-0cb5-4a41-a4ab-9378605ff336","resolution":{"observed_at":"2026-08-07T10:18:48.656650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.488602Z","title":"End-to-end speaker-attributed asr with transformer,","venue":null,"work_id":"0e9f7140-2103-498d-b27f-c645e30000f9","year":2021},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:48.816512Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:4a1014bd659af63c0aae9728b5566d619c192de98e886e4b5bb3f652996517f8","observation_id":"37f24056-4cef-4f4e-872a-5d2bd2541fdc","resolution":{"observed_at":"2026-08-07T10:18:57.636294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:49.072312Z","title":"Streaming speaker-attributed asr with token-level speaker embeddings,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:49.072312Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:ba96a04a20e5e26ec3440cfb8585e9bd68f384018103172b2b7292dbaed636e8","observation_id":"e4bc38a4-514c-4e0f-aaf7-ceef925de09b","resolution":{"observed_at":"2026-08-07T10:18:49.072312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.797160Z","title":"Auxiliary interference speaker loss for target-speaker speech recognition,","venue":null,"work_id":"205fe93b-38a6-4112-a3e3-b2438718fdce","year":2019},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:49.251676Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:90c5ba7caad464adca50cd67d0e79ae8ceceaae09c148164502aa960a2ec30cc","observation_id":"56024215-7799-4f6b-90ac-6042bd091f54","resolution":{"observed_at":"2026-08-07T10:18:56.992755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.323510Z","title":"Conformer- based target-speaker automatic speech recognition for single-channel audio,","venue":null,"work_id":"ed5861f1-0896-4892-bd93-cdd02d0fdba4","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:49.430150Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:424bba1c978a33976aed871c62e8fe54b3e77307076ea82456f6c38f3db512cf","observation_id":"bc9da3ab-26d4-42e7-ac47-7c8d4fdefe5b","resolution":{"observed_at":"2026-08-07T10:18:56.514038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.995579Z","title":"Extending whisper with prompt tuning to target-speaker asr,","venue":null,"work_id":"89487a49-ef8d-4b12-8fb3-13a4e7690424","year":2024},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:49.568686Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:1f0a225d3e3822c37306dabe0608600c137a84f8cc492077623b6639722905a1","observation_id":"346aead5-8527-4efc-89f1-c9f22ae35a6f","resolution":{"observed_at":"2026-08-07T10:18:56.210009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.640537Z","title":"Adapting self- supervised models to multi-talker speech recognition using speaker embeddings,","venue":null,"work_id":"3325cc51-6e63-4462-8b6a-dc19004293c6","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:49.734536Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:9e79696006b1451ab84f06b6cf6abb94b36c0426b07b96536286cedd1782a15d","observation_id":"37920476-61a9-4a53-8e8a-34c95af5e9fe","resolution":{"observed_at":"2026-08-07T10:18:55.796727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.240556Z","title":"Empowering whisper as a joint multi-talker and target-talker speech recognition system,","venue":null,"work_id":"8fb3507c-941b-467a-9dfa-004d55b13a23","year":2024},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:49.846478Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:f35a27cb8b2c4a0607568ba732e630332706224e505c1cae5679ec38f7ea48cd","observation_id":"ae636b1d-81ce-4ba8-9748-e27cddc8117c","resolution":{"observed_at":"2026-08-07T10:18:55.423927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T10:18:49.976744Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:49.976744Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:765867a1eaef6dd98c5fd71d9a81ffc54d0cf294823308fe43b0c223128844c8","observation_id":"ffeb8292-4373-48ef-8acd-da3da4e2bbbf","resolution":{"observed_at":"2026-08-07T10:18:49.976744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T10:18:50.077448Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:50.077448Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:f28c2799c04202f1b0dad85267558a74c5585987f55727cf4008b06788072215","observation_id":"b2b1d17f-ddac-4d28-bf84-58aabff639e3","resolution":{"observed_at":"2026-08-07T10:18:50.077448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T10:18:50.210221Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:50.210221Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:c0640833ef6dde804cbd1ac1d8a9816f4e09cbe66ebaf445880ba2dec5b8b889","observation_id":"000cff5f-cd19-42f7-8d6d-f3c63d10dc20","resolution":{"observed_at":"2026-08-07T10:18:50.210221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.812367Z","title":"M2met: The icassp 2022 multi-channel multi- party meeting transcription challenge,","venue":null,"work_id":"f3277da1-e8a8-4a70-8924-f334a47bc348","year":2022},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:50.365313Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:cf8eb64d27a1bc91b5e32698d11b3b2232898027e24fd228925ac9b11f549711","observation_id":"2180efab-0a2e-4738-bbb0-371c3ac4193a","resolution":{"observed_at":"2026-08-07T10:18:55.088131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.448017Z","title":"Meeteval: A toolkit for computation of word error rates for meeting transcription systems,","venue":null,"work_id":"2ab99efe-d118-4866-943b-889be409c97b","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:50.502377Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:219d661ff2ac51378870bf67d4835e347e4fdbcd8c5f16932ca0f971a1c282c6","observation_id":"66011fc7-a22c-4882-8c55-ed4d9be4af44","resolution":{"observed_at":"2026-08-07T10:18:54.622571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T10:18:50.628216Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:50.628216Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:e701959ad1e5dd533508a9e5bb6568f016c54eb47eb75c79a68d7f6649d35f76","observation_id":"801486c9-2bc7-4312-845a-bd11e17f897f","resolution":{"observed_at":"2026-08-07T10:18:50.628216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.108945Z","title":"V oxblink: A large scale speaker verification dataset on camera,","venue":null,"work_id":"543c3a8a-9c18-4003-b16f-06a53d690582","year":2024},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:50.823454Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:cced81203bf299fbf52424c988c86ad8d6116a43450261a4416f58032c842170","observation_id":"0a90cc38-0f02-40b5-a2ad-e24e58716043","resolution":{"observed_at":"2026-08-07T10:18:54.262814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.883713Z","title":"V oxblink2: A 100k+ speaker recognition corpus and the open-set speaker-identification benchmark,","venue":null,"work_id":"693d36ce-a2ad-4b2a-94eb-a7637c75169b","year":2024},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:50.988675Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:655f8d7348a36bbc24c57108278ab48f613a70b9e1d4c094c0ba642d2d64079d","observation_id":"4f78afb0-9a03-4102-90f9-cb1a70816c95","resolution":{"observed_at":"2026-08-07T10:18:54.023729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.538509Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":"b560fd7d-b7c2-4876-85b2-8bf535308aac","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.147336Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:f8999e9ac7b3d2f9273765cd4196c66e53d80187d610cce52962f4154ad68add","observation_id":"39b93780-8255-491f-887c-3ac98585d8e6","resolution":{"observed_at":"2026-08-07T10:18:53.743113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13849","last_updated":"2025-06-21T06:43:49Z","snapshot_observed_at":"2026-08-13T12:47:28.176326Z","submitted_at":"2024-11-21T05:15:46Z","title":"Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13849","snapshot_observed_at":"2026-08-07T10:18:51.269948Z","title":"Sequence-to-sequence neural diarization with automatic speaker detection and representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.269948Z"},"links":{"cited_paper":"/paper/2411.13849","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:dab8e2bc92745760a9712e61ca40f12afa268c0e576ea69880300f5f3a08d41e","observation_id":"3d33cebb-b5fd-47d7-b599-9828410d05be","resolution":{"observed_at":"2026-08-07T10:18:51.269948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.208058Z","title":"Target-speaker voice activity detection via sequence-to-sequence prediction,","venue":null,"work_id":"783792bc-9bd3-4aed-afd1-db1d83eea0b8","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.461795Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:d592947cca64c10be8b049f8247a02c03e289d89c7a184ace6da2d335ef50c8e","observation_id":"fab60a21-d8ef-452b-b852-a9fe986cd6d9","resolution":{"observed_at":"2026-08-07T10:18:53.357300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.655153Z","title":"Qwen2.5: A party of foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.655153Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:291c6f306d072879304cc809f81c1faa55a5a6b8e77dae9dea292d5e7e264243","observation_id":"5c368eea-06b5-4ebd-aadf-26aaea5af809","resolution":{"observed_at":"2026-08-07T10:18:51.655153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.770378Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.770378Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:c6b33e0e1e5e215cb94891609e4627d73c9b6f4b9e6767e46defe02e4be6d8b6","observation_id":"0db2632f-140a-4448-afce-d095e8da946f","resolution":{"observed_at":"2026-08-07T10:18:51.770378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13306","last_updated":"2025-02-16T08:03:17Z","snapshot_observed_at":"2026-08-15T06:20:21.428418Z","submitted_at":"2025-01-23T01:27:46Z","title":"OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13306","snapshot_observed_at":"2026-08-07T10:18:51.939607Z","title":"Osum: Advancing open speech un- derstanding models with limited resources in academia,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.939607Z"},"links":{"cited_paper":"/paper/2501.13306","citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:33b724bdd02b24b90468fa58e4dc3d0c2d0078479e742eb502e9414e6e2702e0","observation_id":"314f9479-bc79-4f09-bcb5-5fa240649b68","resolution":{"observed_at":"2026-08-07T10:18:51.939607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.926237Z","title":"A comparative study on speaker-attributed automatic speech recognition in multi-party meet- ings,","venue":null,"work_id":"adf3bf07-11a4-49e3-9b17-56279bb3d68a","year":2022},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.106493Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:2c0086901189f101102ff92c07f19a27917b9dfe819e9b99deb0244006380e7d","observation_id":"1fa9ea15-77d6-4f3a-b8c1-78ddd7c64b54","resolution":{"observed_at":"2026-08-07T10:18:53.069598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.157834Z","title":"Casa-asr: Context-aware speaker-attributed asr,","venue":null,"work_id":"275fb65d-d4ef-404e-9c9a-de5b9aaeb252","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.254423Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:2b74ac4e0464666f1c0276457e5f670ec9004a8f9acd0cd33885003359963b48","observation_id":"5bc6a903-a3ec-4597-a90a-9d67dfb09248","resolution":{"observed_at":"2026-08-07T10:18:57.286697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.669764Z","title":"Sa-paraformer: Non-autoregressive end-to-end speaker-attributed asr,","venue":null,"work_id":"1c84f5b5-0f3c-457e-9879-c37a5657573f","year":2023},"citing_paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.399445Z"},"links":{"citing_paper":"/paper/2506.05796"},"observation_digest":"sha256:6c232a3ea7b4cc41a1f039358bbf18b3ea5fb517b8208fe3a006b0e4c23f8c03","observation_id":"e16a9a69-f74d-4592-a6eb-d97a60d0239d","resolution":{"observed_at":"2026-08-07T10:18:52.750199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05796","last_updated":"2025-06-06T06:43:34Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-11T19:39:02.266479Z","submitted_at":"2025-06-06T06:43:34Z","title":"Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 4 inbound Pith citation observations for arXiv:2506.05796."}