{"as_of":"2026-08-08T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f08b1040dde27f664e979347c365ffebf1853e44a548e4256e8f91d17efd1be3","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:15:57.190957Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11344/citation-record","integrity":"/paper/2506.11344/integrity","json":"/paper/2506.11344/citation-record.json","paper":"/paper/2506.11344"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2018-1768","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:58.094265Z","title":null,"venue":null,"work_id":"8da2885e-3b3a-4b74-8edb-c4ec3c0db8eb","year":2018},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:54.728975Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:c590c257c5f4bbc17840257d7ccc26785c39266a3d0eaf1117efbfa0c8e2ea2a","observation_id":"19df71af-a646-453d-bd7f-104a648e1906","resolution":{"observed_at":"2026-08-07T04:15:58.149537Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:59.902068Z","title":null,"venue":null,"work_id":"f45fd7dc-1fc1-4de9-aa68-7a5f42a789c1","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:54.834097Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:0ab0cd008bd0da4c82cf81d2805171a96ecc15cb34466d85b79a8bfcd123cd6c","observation_id":"993142f4-f037-4220-971b-ab252f940ef2","resolution":{"observed_at":"2026-08-07T04:16:00.034386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:54.918846Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:54.918846Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:a629d63bd057b57896c560cde810178973cefe39191181412e4f74b51d148e70","observation_id":"5ed8ae07-b441-4f7b-a5b7-57f8936c76ed","resolution":{"observed_at":"2026-08-07T04:15:54.918846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.35111/d37s-c536","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:57.939445Z","title":null,"venue":null,"work_id":"8784b154-a1ef-4f4f-8d36-353c7423f8cf","year":1996},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.020157Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:ab22d820261e6b4f95c0177cf054baa1a4ae2b59a4e064f0c319fe4b95bfae25","observation_id":"cb01b61f-fd41-4c8f-b598-28dd8044266e","resolution":{"observed_at":"2026-08-07T04:15:57.993991Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:55.109864Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.109864Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:2d4354776e753489666bb1796a90cc1e3631dc46a9de53ade5c3b5ab85b3d719","observation_id":"c994171b-17d3-42ab-91b2-5f4411e4ea5f","resolution":{"observed_at":"2026-08-07T04:15:55.109864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.884","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:57.792112Z","title":null,"venue":null,"work_id":"89215660-fa04-4ddd-b1f2-f1c4d01a6240","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.177313Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:7873aa2111410f2f8ea26c542157384586c3120661e190e630cb30bb7981d085","observation_id":"17be4d74-41e8-4f01-844a-18642bdeb42d","resolution":{"observed_at":"2026-08-07T04:15:57.861434Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:59.675318Z","title":null,"venue":null,"work_id":"9a5e0b5a-fb5d-49ca-80b2-de32c18a2cbc","year":2020},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.283442Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:7cea06c81a483160bbc2ba27313f3f0ecc7eb542c61316b3aca09589516e57db","observation_id":"a1ed1b1b-f3e6-4de4-bb21-50ba6b6d63de","resolution":{"observed_at":"2026-08-07T04:15:59.800209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21415/t5vg6x","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:57.614368Z","title":"Chafe, Charles Meyer, and Sandra A","venue":null,"work_id":"55d61c85-2a07-4309-8c7e-29f7a4a621cc","year":2000},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.365852Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:ea0dc7d5812ece14be66d471f8922ba89fbc02f5cf7e009fed1fc97cd866c9a4","observation_id":"ace6baef-267f-4a29-ace1-3d71ad5e36f5","resolution":{"observed_at":"2026-08-07T04:15:57.690637Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/odyssey.2020-17","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:57.444520Z","title":null,"venue":null,"work_id":"f747f076-bb61-4a97-ac1d-d5a400950354","year":2020},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.466266Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:45190283e616333f776aedf255606870310b8bfb3ab84bfd5cc36184c6990200","observation_id":"2e03906e-358a-43e6-a2ed-311dbcc09d67","resolution":{"observed_at":"2026-08-07T04:15:57.520517Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:55.551726Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.551726Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:0cb7ebdebaeb7807ae8e135f897e1dd91243883e5fefb68692fd50131aa668b3","observation_id":"1e835360-9bfd-41d2-a04c-660acea1262a","resolution":{"observed_at":"2026-08-07T04:15:55.551726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:55.634299Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.634299Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:9b6bcf6c88236cfb00871f6323a43329c6a861fb117c4b40fcbf2694f7da012e","observation_id":"79edbcff-71b0-45fd-9ae9-ec794a32c25b","resolution":{"observed_at":"2026-08-07T04:15:55.634299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.11987","last_updated":"2022-11-10T18:59:00Z","snapshot_observed_at":"2026-07-06T09:07:34.124249Z","submitted_at":"2020-03-24T13:02:59Z","title":"Partially Observed Discrete-Time Risk-Sensitive Mean Field Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.11987","snapshot_observed_at":"2026-08-07T04:15:55.779217Z","title":"Janin, D","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.779217Z"},"links":{"cited_paper":"/paper/2003.11987","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:4a1c15df510f30f9c0e0a077ecd91e2ebfe49e828de9f8f0d733fdc750e089c9","observation_id":"56f28ec8-925f-4801-b71f-28a3d2e7124b","resolution":{"observed_at":"2026-08-07T04:15:55.779217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03151","last_updated":"2022-01-22T01:28:17Z","snapshot_observed_at":"2026-08-06T03:52:39.884353Z","submitted_at":"2021-10-07T02:48:49Z","title":"Transcribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers using End-to-End Speaker-Attributed ASR","version":2},"cited_work":{"arxiv_id":"2110.03151","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.03151","snapshot_observed_at":"2026-08-07T04:15:59.196386Z","title":"Transcribe-to-Diarize: Neural Speaker Diarization for Unlimited Number of Speakers using End-to-End Speaker-Attributed ASR","venue":"eess.AS","work_id":"efbe1b85-86d7-4cb2-9c31-0eb7d78d61fc","year":2021},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.873688Z"},"links":{"cited_paper":"/paper/2110.03151","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:353fb003e20e5285daf15a0c90161477efd84773cfc93e5eb496fd5b81e9373b","observation_id":"5bf6fa3a-dd23-4e8f-b5a0-d3ce690a832f","resolution":{"observed_at":"2026-08-07T04:15:59.267143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04410","last_updated":"2021-10-08T23:49:42Z","snapshot_observed_at":"2026-08-06T03:08:15.868993Z","submitted_at":"2021-10-08T23:49:42Z","title":"TitaNet: Neural Model for speaker representation with 1D Depth-wise separable convolutions and global context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04410","snapshot_observed_at":"2026-08-07T04:15:55.984530Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:55.984530Z"},"links":{"cited_paper":"/paper/2110.04410","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:2453b282018d3bdf55821d3218d96e88d71a569202bea891afbd9245617430fc","observation_id":"8a449894-0fcb-4aea-80f3-7b42929f58de","resolution":{"observed_at":"2026-08-07T04:15:55.984530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:56.124519Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.124519Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:bd6e26cd3501377d738768a3e7a6aba53057c178bb43acb1d66520b7bcf8ae6a","observation_id":"4de9f800-773f-4349-84b4-e4badef5a1ff","resolution":{"observed_at":"2026-08-07T04:15:56.124519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05248","last_updated":"2023-09-14T01:08:08Z","snapshot_observed_at":"2026-08-02T16:08:12.372337Z","submitted_at":"2023-09-11T05:47:56Z","title":"Enhancing Speaker Diarization with Large Language Models: A Contextual Beam Search Approach","version":3},"cited_work":{"arxiv_id":"2309.05248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05248","snapshot_observed_at":"2026-08-07T04:15:58.944909Z","title":"Enhancing Speaker Diarization with Large Language Models: A Contextual Beam Search Approach","venue":"eess.AS","work_id":"54048fad-d16e-4f64-8f9f-2868640eda9b","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.218052Z"},"links":{"cited_paper":"/paper/2309.05248","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:2036d750f7131f8ff8c94afd13160dc474238b91ed8e4d99b5e750e4bc315d6a","observation_id":"080148ad-84de-4e4a-a935-70bdf49bc317","resolution":{"observed_at":"2026-08-07T04:15:59.038611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15974","last_updated":"2022-03-30T01:26:31Z","snapshot_observed_at":"2026-08-06T03:55:26.600763Z","submitted_at":"2022-03-30T01:26:31Z","title":"Multi-scale Speaker Diarization with Dynamic Scale Weighting","version":1},"cited_work":{"arxiv_id":"2203.15974","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.15974","snapshot_observed_at":"2026-08-07T04:15:58.796438Z","title":"Multi-scale Speaker Diarization with Dynamic Scale Weighting","venue":"eess.AS","work_id":"e3446be1-ec76-468a-868a-5d9f5bc251a4","year":2022},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.335846Z"},"links":{"cited_paper":"/paper/2203.15974","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:fd1b031a478a8f7df446329180993325cd4ad5546d85a73b39fd7e964e0f9d15","observation_id":"3942f902-e29f-430b-82eb-ffb37e5f278b","resolution":{"observed_at":"2026-08-07T04:15:58.855167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1982","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:57.306912Z","title":null,"venue":null,"work_id":"8b627bbd-366f-4397-932a-03782899a872","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.441327Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:f97ffd4cf94140a9a6f27bdb08282ced81df570980895ca2aec51d904205cef2","observation_id":"af58f791-1946-4fc6-ae89-d2669e4cb1e4","resolution":{"observed_at":"2026-08-07T04:15:57.370849Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:56.524243Z","title":"Pedregosa, G","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.524243Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:2e79d1913603ac7053634959c06601776286847af386657050f7fccf57e2e046","observation_id":"301c54e8-c851-4259-9ddd-bfd8ba67088e","resolution":{"observed_at":"2026-08-07T04:15:56.524243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:59.436786Z","title":null,"venue":null,"work_id":"501623e9-064e-4d93-98b9-aad178bdb448","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.604502Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:caf7214358f55332be887d3363e135b894093d562ddae86a73088d90616d7221","observation_id":"f58fe505-57b4-4c36-866e-44a38872b049","resolution":{"observed_at":"2026-08-07T04:15:59.558334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T04:15:56.689663Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.689663Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:701b0f394d2b98ef4abe6abf423a4fd8406d45c0d7f55bb7b7756f627b63d055","observation_id":"5092846e-ce14-438f-b405-42cea1176d02","resolution":{"observed_at":"2026-08-07T04:15:56.689663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:56.769223Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.769223Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:39342b386596c0513eec258ecf1145cfe96c6e4b3a09c6b2a8a561fc861b9a59","observation_id":"b064a4f8-1330-442d-a145-63034f2a7c02","resolution":{"observed_at":"2026-08-07T04:15:56.769223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05337","last_updated":"2019-07-09T00:23:22Z","snapshot_observed_at":"2026-08-02T04:08:05.825191Z","submitted_at":"2019-07-09T00:23:22Z","title":"Joint Speech Recognition and Speaker Diarization via Sequence Transduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05337","snapshot_observed_at":"2026-08-07T04:15:56.818718Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.818718Z"},"links":{"cited_paper":"/paper/1907.05337","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:6a1439e2c16c3943834c7f7c041a1ba8dcb435335a7b46d531cfb026ab32e27e","observation_id":"80d5c565-14c0-4f84-9a26-578fc0102d5e","resolution":{"observed_at":"2026-08-07T04:15:56.818718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:56.910787Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:56.910787Z"},"links":{"citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:5d5cceb6dd6aff510d5ac7f392b0a0c2e67d469bbd9bed44edbde14dfec8433e","observation_id":"5c3e1fbd-692c-4af9-b0eb-b9c200824229","resolution":{"observed_at":"2026-08-07T04:15:56.910787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05397","last_updated":"2023-12-13T12:03:39Z","snapshot_observed_at":"2026-07-06T15:00:54.661106Z","submitted_at":"2023-03-08T05:05:26Z","title":"TOLD: A Novel Two-Stage Overlap-Aware Framework for Speaker Diarization","version":2},"cited_work":{"arxiv_id":"2303.05397","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05397","snapshot_observed_at":"2026-08-07T04:15:58.390853Z","title":"TOLD: A Novel Two-Stage Overlap-Aware Framework for Speaker Diarization","venue":"cs.SD","work_id":"a4a53d41-2d5c-4ffd-9f12-5963ca8e5597","year":2023},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:57.027068Z"},"links":{"cited_paper":"/paper/2303.05397","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:5a5b59b0ae1e92e5eb56b3248b1958165fc2a10c9b84dd5b912ee9d46f19284f","observation_id":"bb8a8c06-2f04-4733-acc7-4a8a7c0ad7f4","resolution":{"observed_at":"2026-08-07T04:15:58.644634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10468","last_updated":"2022-01-23T23:10:05Z","snapshot_observed_at":"2026-07-06T06:06:33.136974Z","submitted_at":"2017-10-28T13:59:17Z","title":"Speaker Diarization with LSTM","version":7},"cited_work":{"arxiv_id":"1710.10468","doi":null,"metadata_source":"pith","pith_arxiv_id":"1710.10468","snapshot_observed_at":"2026-08-07T04:15:58.250956Z","title":"Speaker Diarization with LSTM","venue":"eess.AS","work_id":"7889f39e-2ed6-4999-ab96-e9531a187217","year":2017},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:57.099168Z"},"links":{"cited_paper":"/paper/1710.10468","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:26df54506c640551f7e8d847f803107f09c7925d5fb1966edf2c26832c4af991","observation_id":"ad09241f-898f-46c1-984a-091958cd9c27","resolution":{"observed_at":"2026-08-07T04:15:58.310770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03506","last_updated":"2025-01-08T21:53:33Z","snapshot_observed_at":"2026-08-05T23:31:28.236223Z","submitted_at":"2024-01-07T14:54:57Z","title":"DiarizationLM: Speaker Diarization Post-Processing with Large Language Models","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03506","snapshot_observed_at":"2026-08-07T04:15:57.190957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:57.190957Z"},"links":{"cited_paper":"/paper/2401.03506","citing_paper":"/paper/2506.11344"},"observation_digest":"sha256:19dfaa5cccf34d676d4aa482de3981297c2a8b1ed98d2f4593ed866053f09322","observation_id":"a53b12da-abca-4030-807c-aecd224d6911","resolution":{"observed_at":"2026-08-07T04:15:57.190957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11344","last_updated":"2025-06-12T22:31:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:37:11.339142Z","submitted_at":"2025-06-12T22:31:02Z","title":"Do We Still Need Audio? Rethinking Speaker Diarization with a Text-Based Approach Using Multiple Prediction Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2506.11344."}