{"as_of":"2026-08-08T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd1dbd11197876be9efab04a8b069eb4fe2fb7cf9c24d9b27d88a1b38f4857e0","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:31.681017Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:27.194061Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:09:31.948054Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.12059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12059","snapshot_observed_at":"2026-08-07T12:09:31.948054Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","venue":"eess.AS","work_id":"f9a9d5f7-04af-409e-bb27-e944d6c0b3f2","year":2025},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.194061Z"},"links":{"cited_paper":"/paper/2506.12059","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:94926cb320a5664269089b270a15f4196dcff44b5fb9805e022b2d40485a4c01","observation_id":"b461f765-2c49-4a8f-8416-d99f9493532f","resolution":{"observed_at":"2026-08-07T12:09:32.043276Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12059/citation-record","integrity":"/paper/2506.12059/integrity","json":"/paper/2506.12059/citation-record.json","paper":"/paper/2506.12059"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:36.901954Z","title":"Existing methods include permutation invariant training [1], heuristic error assignment [2], and serialized output training (SOT) [3]","venue":null,"work_id":"a2001c6d-ed0f-4523-ac8e-a6da7e6d623d","year":null},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.096523Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:f14e3a70f8f196941288ef62a6d7509d5f72ed8cf8f06bfaf680b55eb3dabd89","observation_id":"2f166041-70c8-4788-8014-850c38db052e","resolution":{"observed_at":"2026-08-07T12:09:36.991259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.12059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12059","snapshot_observed_at":"2026-08-07T12:09:31.948054Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","venue":"eess.AS","work_id":"f9a9d5f7-04af-409e-bb27-e944d6c0b3f2","year":2025},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.194061Z"},"links":{"cited_paper":"/paper/2506.12059","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:94926cb320a5664269089b270a15f4196dcff44b5fb9805e022b2d40485a4c01","observation_id":"b461f765-2c49-4a8f-8416-d99f9493532f","resolution":{"observed_at":"2026-08-07T12:09:32.043276Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:36.697050Z","title":"Transcribe speech to text","venue":null,"work_id":"ff78124d-04ac-433e-9315-366c7d7550fe","year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.311984Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:85528efbd17b6ac827f485b604b38c1e16411a34ad0c932a042d1d324d3bc544","observation_id":"c7ae2404-c86f-405f-8739-31362014eaa8","resolution":{"observed_at":"2026-08-07T12:09:36.796717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:36.413182Z","title":null,"venue":null,"work_id":"f3995427-18ab-43de-93f0-ac60755a4435","year":null},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.426044Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:57fe26592a7e6ff06d4a401fd5e3d9b5939be44c0c7f8e2907202f376d8f4008","observation_id":"1e54c0ba-37f6-4dcb-9557-2c117dee0b42","resolution":{"observed_at":"2026-08-07T12:09:36.571332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:36.097858Z","title":null,"venue":null,"work_id":"d8200565-97fb-4c8e-b7ed-5c4b1ef243fd","year":null},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.582404Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:c721981d10b499d11ed9701a4dc2daaf70fab9c0ef241b3c6bc0e0177feb30e5","observation_id":"c807d938-5570-49a6-a8ff-916adecf83ca","resolution":{"observed_at":"2026-08-07T12:09:36.250615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.854809Z","title":"Multitalker speech separation with utterance-level permutation invariant training of deep recurrent neural networks,","venue":null,"work_id":"6991472e-9c4b-4b9d-992a-460b2523812d","year":1901},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.739043Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:55cbc7dbdb7f0333fcf3883ef46efbb6c5c02072656dbe048e71a441402a328b","observation_id":"ca569c3a-fed5-442f-b30d-4f958f595b67","resolution":{"observed_at":"2026-08-07T12:09:35.971511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.645310Z","title":"Streaming end-to-end multi-talker speech recognition,","venue":null,"work_id":"c9cf8bb1-bf50-4f8b-8c11-beae4242f200","year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.880286Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:30232c350a0c94a506167ae18e0dc2de82bf2f432850036f576f7da9d5d12ceb","observation_id":"61276b1c-657c-4484-b73c-9543a418336e","resolution":{"observed_at":"2026-08-07T12:09:35.713430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.409554Z","title":"Serialized speech infor- mation guidance with overlapped encoding separation for multi- speaker automatic speech recognition,","venue":null,"work_id":"04ddbafb-7018-4882-9a2f-8010b9307239","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.996458Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:6ba4ba0749e14c09d18e4779bedfc1a4220e76d14e58f9893e1448d07aacec76","observation_id":"f75606b1-65c9-4335-8ba4-14a347eea713","resolution":{"observed_at":"2026-08-07T12:09:35.542048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.202122Z","title":"Enhancing recognition of rare words in ASR through error detection and context-aware error correc- tion,","venue":null,"work_id":"df5a425f-cf8f-43b7-be35-a804bb65997a","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.136386Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:dc66d314f891d9bb6004a1609a75aacb0122b30628c7b9051e0378767498b657","observation_id":"c9fc9649-8968-43f7-8e7f-1a327b65b689","resolution":{"observed_at":"2026-08-07T12:09:35.278660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:28.271198Z","title":"Deep shallow fusion for RNN-T personalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.271198Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:3e6bbec77a72c4c2b4083341ef187c2ed070734368fa57c3a5de3ec3ce523a30","observation_id":"2d0e8287-0267-4ee5-9125-e6c945418fca","resolution":{"observed_at":"2026-08-07T12:09:28.271198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.036274Z","title":"Graph neural networks for contextual ASR with the tree-constrained pointer generator,","venue":null,"work_id":"173dd514-17ef-4204-8a6f-1c7fcb535830","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.386644Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:304c72c72c08902a492b072f38d408a7be8b687b6d090068bc91734fb445ad19","observation_id":"b0dffb9e-a7f5-4470-9c27-afee65a11ed8","resolution":{"observed_at":"2026-08-07T12:09:35.109104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.729580Z","title":"ED-CEC: Improving rare word recognition using ASR postprocessing based on error detection and context-aware error correction,","venue":null,"work_id":"6ec02aab-68f8-4abd-baf4-255856a84513","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.670237Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:f320f6ce7ebe4a017f51a69524bbdfa8f88cdfc1a0d836632f965e5b69fc3dba","observation_id":"ec71b4a3-470b-461b-a447-28badc114258","resolution":{"observed_at":"2026-08-07T12:09:34.826738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.561785Z","title":"MF-AED-AEC: Speech emo- tion recognition by leveraging multimodal fusion, ASR error de- tection, and ASR error correction,","venue":null,"work_id":"490a0822-0ce7-44bd-a2a6-c70741e1abf5","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.822009Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:0a15e32c96ebd97492faee53ed9c14032ad1e948b0c27cf1448dba7f7870525a","observation_id":"e66b1950-6ca7-40e5-8891-fd0454c628fb","resolution":{"observed_at":"2026-08-07T12:09:34.676736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.359718Z","title":"PMF-CEC: Phoneme-augmented multimodal fusion for context-aware ASR error correction with error-specific selective decoding,","venue":null,"work_id":"1a82195a-b75b-427b-9db8-1ced4bffe7a4","year":2025},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.952457Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:e877d2bcaa9455af4d2f664e0d0ff5eb80c70a678df1a5faedf43222c163c018","observation_id":"2515c3c8-c2f3-4ccc-8f96-fab159f99164","resolution":{"observed_at":"2026-08-07T12:09:34.443019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-07T12:09:29.130086Z","title":"Seed-ASR: Understanding di- verse speech and contexts with LLM-based speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.130086Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:7ca5b6c8b9f4e4393a88238dc115a70ae9a4b2c616c85becab6339c25df0a030","observation_id":"a1f20979-b550-4282-b092-91f0057acbfd","resolution":{"observed_at":"2026-08-07T12:09:29.130086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-07T12:09:29.261712Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.261712Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:a336141a1cc55be6c98e29758c0bc817b79e0bdf58c8a52a6fafbc0bc3d8be44","observation_id":"742981cb-d519-4ac6-965e-c5f737cccefb","resolution":{"observed_at":"2026-08-07T12:09:29.261712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.264376Z","title":"Large language model can transcribe speech in multi-talker scenarios with versatile instructions,","venue":null,"work_id":"044d82e1-f04e-4f2c-ba17-34f24c24ed25","year":2025},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.370985Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:3d799182ce5b2a91ade453bc14abf037529a56c0e53beb881302b47f141a9070","observation_id":"0ca27cd7-abd9-47e4-a07e-69644ea67af7","resolution":{"observed_at":"2026-08-07T12:09:34.300344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.042417Z","title":"Advancing multi-talker ASR performance with large language models,","venue":null,"work_id":"9a6a2be4-22d9-41da-8119-06bffc94edf2","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.473099Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:631ffc73353db6dc118bb9b648f3a15e3c7d3f9ab85433768f3aee4c98d8f84a","observation_id":"3ac6585b-72d9-48c4-98f5-6855240ee6e9","resolution":{"observed_at":"2026-08-07T12:09:34.143208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.894258Z","title":"Mala- ASR: Multimedia-assisted LLM-based ASR,","venue":null,"work_id":"7b271f6c-017f-4a2a-bb76-2622d071a22e","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.613364Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:84b1f1591cde7335056a8dfea62e1f808cae5a32e6cd7d3d36485df6a84c9dbe","observation_id":"5e973967-77ff-41fb-912b-193968c8f823","resolution":{"observed_at":"2026-08-07T12:09:33.950566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:29.705109Z","title":"Seri- alized output training for end-to-end overlapped speech recogni- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.705109Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:e469a2ea20ac6969ebde5581c9031a477a1aaf594fbd51b56d258f88cc4e274f","observation_id":"40f0caa1-7973-473a-ab2a-3615434154bc","resolution":{"observed_at":"2026-08-07T12:09:29.705109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.763337Z","title":"WavLLM: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":"2a9ddba0-3cad-4427-be0f-6d6ee1b2a8c8","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.812879Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:8d020babe5dff5e812b73990c40c8a31cb80f860d41d0fd846e531b12c99158b","observation_id":"937de7f4-5dc5-4a00-8271-8539a28c7050","resolution":{"observed_at":"2026-08-07T12:09:33.822269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.649970Z","title":"Two stage contextual word filtering for context bias in unified stream- ing and non-streaming transducer,","venue":null,"work_id":"b4c0ecd9-abf7-4f01-a9c3-52177e18dc62","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.949414Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:1d6cdfee6f9ccd006cfa5d490f572134a98141f78c7b9d0927718702e4d54ac7","observation_id":"01f6460a-ca94-466a-bb68-6d402333d7e2","resolution":{"observed_at":"2026-08-07T12:09:33.704550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.881667Z","title":"Contextualized end-to-end speech recognition with contextual phrase prediction network,","venue":null,"work_id":"f04a8e90-9ceb-4edb-b197-535c8048d874","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.070448Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:1065ec591783cc7a4bf3f2d798278c31a5a0ea4866486ef6288d84837b9b36ce","observation_id":"fda5c2b6-fee4-466c-a53e-d8c6cf3e0343","resolution":{"observed_at":"2026-08-07T12:09:34.966539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.481079Z","title":"Adaptive contextual biasing for transducer based streaming speech recognition,","venue":null,"work_id":"daf0588a-f259-4e89-b8d9-9ada040b29fe","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.132555Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:129c39e6a957fdbe9d30b4eb5c1264371b363036c019cb369033628501405585","observation_id":"2586af90-b68e-412d-b6ce-1a4e13a23403","resolution":{"observed_at":"2026-08-07T12:09:33.549118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.329687Z","title":"CTC-assisted LLM-based contextual ASR,","venue":null,"work_id":"787b71fe-8b52-46ea-9ab9-09fc7f43c062","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.230634Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:752f796029e004a6e7a8b4c8f40714cecd7673ffb45e0123fa0bacca6cafe11b","observation_id":"62dea830-2b92-425c-8925-793a371dc7b9","resolution":{"observed_at":"2026-08-07T12:09:33.394411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:30.324763Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.324763Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:d0f9bcdc2403da717bfea6792737f4f8e7f48ba88a775954f5415df047b1fd5c","observation_id":"b6313a98-478d-4d11-9d1b-2ac9a3689ad8","resolution":{"observed_at":"2026-08-07T12:09:30.324763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.161918Z","title":"Vicuna: An open- source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":"7ff8a43b-c94e-4e27-b2d0-acbbf8d1c030","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.425177Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:5862c1f7144182f91c77b279fba584fe7a81ccf4e0383b9e67e85c1e5f24a9ea","observation_id":"0ba2566a-cde5-4b61-8f0e-e169c6c43470","resolution":{"observed_at":"2026-08-07T12:09:33.227424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:09:30.543058Z","title":"LLaMa: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.543058Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:226656374f71f6efebffc8a2f19d05e9ced7acd4ea7c12fa782be6c8edea6a51","observation_id":"f595921b-1348-44e9-b8f7-90e00f82821e","resolution":{"observed_at":"2026-08-07T12:09:30.543058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:09:30.661940Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.661940Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:296ea97dbcaffba03a69c70b5316459d2a74080da4b3d6928553b1a777327320","observation_id":"1c32bd28-7c18-471f-95a0-0c0fba849fb7","resolution":{"observed_at":"2026-08-07T12:09:30.661940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.029604Z","title":"Multi-speaker ASR combining non-autoregressive conformer CTC and conditional speaker chain,","venue":null,"work_id":"669b1ae3-3d04-434c-b325-d020b0177c55","year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.745173Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:23c8a29daa768b505408fd02a3e15ad2877c8bc277c38ae9d52a7e1c587687c8","observation_id":"c9e4d756-8332-4fb5-a2e6-f07c472be072","resolution":{"observed_at":"2026-08-07T12:09:33.080521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.899554Z","title":"SURT 2.0: Advances in transducer-based multi-talker speech recognition,","venue":null,"work_id":"0f7a06cc-184f-45c8-afd9-bbe772795ecf","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.910459Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:4e142f6480709234418590729f150ec579f3d6388fc8c7311347679d5738e92a","observation_id":"b655d788-8d15-4223-9a56-faca7f3cf113","resolution":{"observed_at":"2026-08-07T12:09:32.956297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T12:09:31.011992Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.011992Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:def991685f526c16035d80f8899784993576567a9e0b3ccd8003b641326db1fa","observation_id":"c9f657fd-e3a5-423d-b32a-b959443a57b8","resolution":{"observed_at":"2026-08-07T12:09:31.011992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.735649Z","title":"The AMI meeting corpus: A pre-announcement,","venue":null,"work_id":"9e9b2257-979d-44b7-b5b6-3897a8a4969f","year":2005},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.125217Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:8ec2f38d944ee618d0b953271d948dd48f7770580c8d210689f4d051c0ce198d","observation_id":"eac9a3aa-e557-4698-acc1-eb4626949113","resolution":{"observed_at":"2026-08-07T12:09:32.829565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.585697Z","title":"Lib- rispeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"521a3b70-47bc-4c3d-85f4-f020844281d5","year":2015},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.230722Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:138c18b46600391eeca450a2568cc81a62cad1b0bdf7f89429a131365f3ae953","observation_id":"3a94d443-1457-4b92-a0de-8187da9f7fbb","resolution":{"observed_at":"2026-08-07T12:09:32.651434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.455296Z","title":"Wham!: Extending speech separation to noisy environments,","venue":null,"work_id":"e7af00aa-cc2d-4793-8cc9-4ab51e7cf202","year":2019},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.358142Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:c63dbb43bee4bfd4d5a3ba4239e78dea709ef8bc3e7d675536195c8c72270991","observation_id":"99f2038c-8547-442a-aa41-55d50fc30471","resolution":{"observed_at":"2026-08-07T12:09:32.515155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.325318Z","title":"Acoustic beamform- ing for speaker diarization of meetings,","venue":null,"work_id":"25b07ff1-c8b5-4ab2-9db4-761c202e7e44","year":2011},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.477173Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:d18954a3b0d96f05a37a7dc0226d1698429fc1289c09816e9504d8027c894a23","observation_id":"ddf434f9-8855-43b3-abf6-a52f9b21ab96","resolution":{"observed_at":"2026-08-07T12:09:32.378574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02194","last_updated":"2021-06-11T23:10:43Z","snapshot_observed_at":"2026-07-06T10:56:42.387460Z","submitted_at":"2021-04-05T23:59:43Z","title":"Contextualized Streaming End-to-End Speech Recognition with Trie-Based Deep Biasing and Shallow Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02194","snapshot_observed_at":"2026-08-07T12:09:31.575701Z","title":"Contextual- ized streaming end-to-end speech recognition with trie-based deep biasing and shallow fusion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.575701Z"},"links":{"cited_paper":"/paper/2104.02194","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:09a16aa9647936d2b4fb06bf9b5568b1ed60e593d24645ee397bfbcbaac1f623","observation_id":"535de2c2-7f28-4551-9321-9a34cc7d17f2","resolution":{"observed_at":"2026-08-07T12:09:31.575701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.151982Z","title":"Tree-constrained pointer generator with graph neural network encodings for contextual speech recognition,","venue":null,"work_id":"4b8fda03-8cf1-466f-9a87-4c5954fd0c1f","year":2022},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.681017Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:6901f981146964ce78fced460c700878b12ba517827477a3088a21aad22a4ced","observation_id":"6df68e98-6b42-4f22-a91e-d6ca83afadfe","resolution":{"observed_at":"2026-08-07T12:09:32.253993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T13:59:09.571873Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2506.12059."}