{"as_of":"2026-08-03T22:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1e6e4e13915585709abc9619296c036fc0f2aa98942182b94b32173d4c2b56f","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:08:56.412939Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.11269/citation-record","integrity":"/paper/2604.11269/integrity","json":"/paper/2604.11269/citation-record.json","paper":"/paper/2604.11269"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Despite these successes, conventional ASR systems are limited to transcribing what was said, without identifying who said it","venue":null,"work_id":"e789ae0e-a312-417c-95f7-da45d98412b1","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:b411b17d8cfbb3950c02d001646348e408044ef540bac94f70dae03ca9a6eb66","observation_id":"c6a7c183-e9f3-41d9-8f8f-2689e1e16fa6","resolution":{"observed_at":"2026-05-18T07:42:30.205760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f989654a-e167-42b4-888e-1ad81149af79","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:8f40052dec091be9ec6545c13b72957dd7c5d4ee69da8a9e9bfb2dc3aec015d8","observation_id":"c03861f1-d5f0-4152-9caf-df3960633bff","resolution":{"observed_at":"2026-05-18T07:42:30.208510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"38149035-dd3d-4568-9a3f-b3b59c8329c5","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:ce51cc4d99b2f2e33555f906bfa07e0b4f6724b364b0ecdb3c3fc8ec4a95474f","observation_id":"05a42f44-c759-4def-a802-119aebadc343","resolution":{"observed_at":"2026-05-18T07:42:30.159962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Therefore, training and evaluation were conducted on audio segments of up to 120 seconds in duration","venue":null,"work_id":"82155535-22b7-453e-a4d6-84334b6b5f0d","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:37c5864ca1807e7021de02ce1f1b9077ece27963bb953ae731d9c46068bf46c3","observation_id":"95a98bcf-b538-487c-859b-d31afed7789f","resolution":{"observed_at":"2026-05-18T07:42:30.169765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc13992a-2f1a-4ca0-a005-c85a974b8020","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:4860650b9e92538c67f097129ad219c0df6136b40e992d4dcc1165b97e59cc38","observation_id":"6374251c-ea34-4bce-b1d0-55d1177fe9ab","resolution":{"observed_at":"2026-05-18T07:42:30.146769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AMI-SDM [18] is a multi -speaker meeting corpus frequently used for SD tasks","venue":null,"work_id":"f4f2975a-fbf4-43f2-828c-a0fad59fc397","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:de021ba4326ad66c4c24d5f29274008f0909a30a2766140daabb1df396022f5f","observation_id":"cd6cdaa8-ce1f-4f04-bcc3-a6524eccc87e","resolution":{"observed_at":"2026-05-18T07:42:30.178369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We average results over test durations of 10, 30, 60 and 120 seconds","venue":null,"work_id":"7c724b3b-1591-4660-a482-84ba10875956","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:08bafda2500ed8811cd45e8ecec41829ea9093089e0892b5eedf18baaa3cbd4e","observation_id":"1a8ddd3e-c75c-429c-8f95-021abb4a1115","resolution":{"observed_at":"2026-05-18T07:42:30.191817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Our research demonstrates that our approach offers a more robust and effective solution compared to traditional pipelines that rely on separate SD and ASR systems","venue":null,"work_id":"c0d7df05-fde6-48f8-9d60-39edc06c8bfc","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:ba738fa863acb50962720b8aead2c00c80f359962c7a13ab6c1fa9a23fd86ae4","observation_id":"9545d6d1-543b-4a9a-8385-8f5c064b194a","resolution":{"observed_at":"2026-05-18T07:42:30.185507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving Speaker Assignment in Speaker - Attributed ASR for Real Meeting Transcription","venue":null,"work_id":"80713ccd-cd99-4a86-b2b2-c2594d798bc6","year":2024},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:951826fa3549d34db5b9636ae4ec79372522244b426568489afd37d2ab997a6c","observation_id":"ae2db3d5-2ec0-4039-b46a-47878e32bdc2","resolution":{"observed_at":"2026-05-18T07:42:30.202693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Comparative Study on Speaker -Attributed Automatic Speech Recognition in Multi-party Meetings","venue":null,"work_id":"d7efbbac-cf5f-4ec5-a9e0-8312ee8e45d6","year":2022},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:feb7df19ea661058d3f41aa97fb9c2f0ade51b5a200509655fdb1761080132f3","observation_id":"6e1e64ee-8393-4a55-b117-cfb2d79190f9","resolution":{"observed_at":"2026-05-18T07:42:30.211451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","venue":null,"work_id":"ad640f1a-b789-40fd-a236-cb4340d4a6d8","year":2019},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:38237595ec99e3c2eb8d9e9c818831adfa4e8b45e77a771800a4f5bbc14cd5f4","observation_id":"d2e77555-9721-4082-a118-41a3851305ba","resolution":{"observed_at":"2026-05-18T07:42:30.214644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":"fb15f0f1-44ff-4a27-82c4-8512221bdc7f","year":2024},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:500da33c369d4a667315ef78965e4ecf77aedb0eb089107a60db829960dfbdfd","observation_id":"f171e983-1137-44a2-aa4c-6eba045f0125","resolution":{"observed_at":"2026-05-18T07:42:30.194852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-03T17:17:30.602291Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":"2402.08846","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-07-10T20:37:34.440026Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity","venue":"cs.CL","work_id":"d0cf5313-bc88-4f8f-9a2c-9012a25a93dd","year":2024},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:49609ff4f052bc008f9ab5e39d9c299eaeb7ea640b3cc95f18ef4478c5bf7402","observation_id":"96265c51-0a44-4540-9c46-f7f1196ab634","resolution":{"observed_at":"2026-05-11T11:11:00.884611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:eb39842efdcbdba04cdc87766884ab406ce3bfe352cf3bea7f309e0fcca264cf","observation_id":"bd9ea5f8-f59b-491e-ad1c-ff72371925c7","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AIR -Bench: Benchmarking Large Audio - Language Models via Generative Comprehension","venue":null,"work_id":"2d24487c-9ab2-442b-983c-77d0c9f0b2c4","year":2024},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:fcaccedbbfc2054f0305dba05a3bcb746f69b1593535167f825c595e4ee9ef9f","observation_id":"3f4f255c-8dc2-4e6b-bd91-7cd989a92780","resolution":{"observed_at":"2026-05-18T07:42:30.156740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DiarizationLM: Speaker Diarization Post - Processing with Large Language Models","venue":null,"work_id":"2725d966-e697-45e6-bcdf-a8c659ae887f","year":2024},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:94be0682535874f05c2dd2a3d21b36ecfac6913336de128b0dfe8b6fe5edec94","observation_id":"96763627-767f-46de-92b2-d0a25ce66b61","resolution":{"observed_at":"2026-05-18T07:42:30.125228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Granite -speech: Open-source speech -aware LLMs with strong English ASR capabilities","venue":null,"work_id":"44d12ffc-704d-49a9-86ea-df0d0696aa0e","year":2025},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:f9a2796fdfcee5848973a5a7640ddc84360d6be54aa7002d7913fe217e410249","observation_id":"7b76daa1-def2-4a53-8432-671513930704","resolution":{"observed_at":"2026-05-18T07:42:30.197797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:066d40d987b27754cc8be504a5cc7537639dd58cc4b3bb2031f8cacb4e90cc2c","observation_id":"14fb87a4-ad11-4e41-ad8c-e1eeaf9e3361","resolution":{"observed_at":"2026-05-11T11:11:00.875410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of conformer CTC-encoder for speech emotion recognition using large language models","venue":null,"work_id":"ba502179-9db4-4da3-9d2f-ffff34352e02","year":2025},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:cefa461303251f3981aed42daeef91f9b9131c65936659a24c0a293b28048513","observation_id":"8e637df7-9267-4329-93b0-034eda425845","resolution":{"observed_at":"2026-05-18T07:42:30.188148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ESPnet -SPK: full pipeline speaker embedding toolkit with reproducible recipes, self -supervised front-ends, and off -the-shelf models","venue":null,"work_id":"fc05a30c-632e-4d2e-b909-83fde9dab09d","year":2024},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:474031f2737a5b082357a2c72cb0afd950b1551e1e279ec65156079c81a8f4d9","observation_id":"078984d5-0213-431e-827e-befa85b4699f","resolution":{"observed_at":"2026-05-18T07:42:30.172682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ESPnet: end -to-end speech processing toolkit","venue":null,"work_id":"25c81e4c-0f77-435b-9432-fa9f2eafae7c","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:16b9184814cf210542f3486bdb35213413b2168050281d7600f4d2b0c2a3d226","observation_id":"8d2b3c77-cb13-4a3d-8dfb-2b2fdb96eee6","resolution":{"observed_at":"2026-05-18T07:42:30.144830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Some Methods for Classification and Analysis of Multivariate Observations","venue":null,"work_id":"29004ad1-de50-4212-b9f3-8ee0c6e6ce28","year":1967},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:eb8ee1be6f712bd4fe46a9c08f0d6960c61f83e84227e68f26f66f233c19418e","observation_id":"a801508b-9fc3-4910-aa61-861e5966b4bd","resolution":{"observed_at":"2026-05-18T07:42:30.166784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T he Fisher Corpus: a Resource for the Next Generations of Speech-to-Text","venue":null,"work_id":"259a14a0-2f3a-4473-83c9-d90c1120ca50","year":2004},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:c439df4f73a54c52ab1be57da06d64a0cb99b3d6fcf7bcad133d7e672642d73f","observation_id":"65175bf6-b52f-4cab-8101-7b7e49415288","resolution":{"observed_at":"2026-05-18T07:42:30.182803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CALLHOME American English speech","venue":null,"work_id":"c277d8a1-6e8b-4268-83d5-f3e01ab7b1a7","year":1997},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:fc56a313d9e2352bd231f50f7181dfbbef98ac558fc8a5d0508f8aa1d332dd28","observation_id":"8a341f05-4927-43c4-ad35-bb56b02e4b1c","resolution":{"observed_at":"2026-05-18T07:42:30.200241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The AMI meeting corpus: A pre announcement","venue":null,"work_id":"7a378405-9313-44f0-9fe5-21c48b4c8527","year":2005},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:54acb7cd7127d7fb6caa18d557664101d4ba8a3100ddae88c197290553cc9430","observation_id":"182e9ec9-90db-4a37-ba63-abe263da8e07","resolution":{"observed_at":"2026-05-18T07:42:30.180468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards naturalistic voice conversion: Naturalvoices dataset with an automatic processing pipeline","venue":null,"work_id":"836eb3ee-0d8d-4683-b726-6a6452621842","year":2024},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:b5d3d00f12baea81c95e0f1797feafab2d8a0ffb615438696ebf686f693509fa","observation_id":"0c92ae7d-2bb8-4c1a-8b1b-10c66ac6098e","resolution":{"observed_at":"2026-05-18T07:42:30.175023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15953","last_updated":"2021-03-29T20:58:10Z","snapshot_observed_at":"2026-07-06T10:54:39.400060Z","submitted_at":"2021-03-29T20:58:10Z","title":"TREC 2020 Podcasts Track Overview","version":1},"cited_work":{"arxiv_id":"2103.15953","doi":"10.48550/arxiv.2103.15953","metadata_source":"arxiv_reference","pith_arxiv_id":"2103.15953","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":null,"venue":null,"work_id":"b6415e4f-46c7-4f4b-8d24-44b5fef0d589","year":2021},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"cited_paper":"/paper/2103.15953","citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:6a23618448b75c703bb48ab4b82d4799fd2e2c20cc4b92432474d2cb800ac8e7","observation_id":"2b7dd530-8434-4302-9494-a3dcf936d9bc","resolution":{"observed_at":"2026-05-10T15:10:31.074827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The GALE project: A description and an update","venue":null,"work_id":"c7b8f344-6494-47cb-afea-6a2bed117392","year":2007},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:db299ed9ccfffd5aff6483849b883ffa432ef3739a4b6b5eb7cecc3e19a7bf14","observation_id":"2e188451-2a6a-4d11-990f-6831062da850","resolution":{"observed_at":"2026-05-18T07:42:30.156514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MLS: A large -scale multilingual dataset for speech research","venue":null,"work_id":"d737613d-f91b-40ce-87c6-44d4d68af54b","year":2020},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:5649b35b6f06f93cbd7018b47fa6f46eae64c0d4794474f163dd960bf3d23343","observation_id":"61ae6d64-12e8-4929-8b15-2d032f5d8cc2","resolution":{"observed_at":"2026-05-18T07:42:30.160351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe","venue":null,"work_id":"3daf47d6-d463-49f7-81af-178e0fa2855e","year":2023},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:1b9841b66d2471ec59742b262a11b3a54208aa0696280f5b7c78795fc254fe76","observation_id":"ae541b08-47d5-4c5f-9d85-e5d3ef65c2d9","resolution":{"observed_at":"2026-05-18T07:42:30.163668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Powerset multi-class cross entropy loss for neural speaker diarization","venue":null,"work_id":"9eb993f2-b29b-4a4c-a2c5-878d8a7e8b12","year":2023},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:ce85dc00d7e45d6df3840bc503f86d92c377c0ba29e2245d3a65d86f8517bf04","observation_id":"b9ca8340-a00b-45e3-b9e0-3a3dac236c14","resolution":{"observed_at":"2026-05-18T07:42:30.151160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large -scale weak supervision","venue":null,"work_id":"a1a8e3b9-8e87-4fcb-bf17-059056fa65f8","year":2023},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:6f129bf2bc0a260e1daaffa5729be43676a553eebb75a3645e11b44dbacddc97","observation_id":"958fc94a-efba-4601-bd6f-b6dd2e89c30e","resolution":{"observed_at":"2026-05-18T07:42:30.178203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"18d50930-9e65-4e5d-9962-b7001e339b78","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:befee05fe20507c0d4d7caf077806f4eac27939944e51893513426535aa03e15","observation_id":"13f2f14f-4a5d-4f12-b392-80584d838a73","resolution":{"observed_at":"2026-05-18T07:42:30.153771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5b3bc7f4-d996-46e9-bbeb-f0065d4a6aaa","year":null},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:9d84eb35a6009022ccd6b93c6bf8e768eb14acb672383988b129999f0cdd8edb","observation_id":"8d5e667c-b5ae-4e8d-9575-dd537acc78f2","resolution":{"observed_at":"2026-05-18T07:42:30.149899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2604.11269."}