{"as_of":"2026-08-15T14:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3453ba255459eb42df9ccd2f82d1bb0507495153e6114c92b5ae5a333841cc4b","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:05:39.516845Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:23:24.503068Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:26:55.801813Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-07T12:23:24.503068Z","title":"Di- CoW: Diarization-conditioned whisper for target speaker auto- matic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.503068Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:530c89a8e4dce4428049586dc34c3f33909678ae34ea088964bad34f7d13511a","observation_id":"4fd78155-4eda-4b50-bdae-3aa0155d3660","resolution":{"observed_at":"2026-08-07T12:23:24.503068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-07T00:50:17.227570Z","title":"Di- cow: Diarization-conditioned whisper for target speaker au- tomatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.227570Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:8f7ac4e2961a3fe15b909c75f5e67ca4962ec7e0176400e33d7d126684054d5b","observation_id":"33eeac7b-ef79-4c00-9143-2aa993c6071f","resolution":{"observed_at":"2026-08-07T00:50:17.227570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":"2501.00114","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-06T19:26:55.801813Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","venue":"eess.AS","work_id":"0b21dc5f-b145-4669-b594-aa61ac1f163b","year":2024},"citing_paper":{"arxiv_id":"2507.05609","last_updated":"2025-07-08T02:37:20Z","snapshot_observed_at":"2026-08-14T15:26:00.046501Z","submitted_at":"2025-07-08T02:37:20Z","title":"MMW: Side Talk Rejection Multi-Microphone Whisper on Smart Glasses","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:53.977592Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2507.05609"},"observation_digest":"sha256:f3743b583e3f5a1d4985e493d5e1222ac64b6a8f492284725e7feb203e767b55","observation_id":"19f421df-b12b-40bc-a020-db724361690f","resolution":{"observed_at":"2026-08-06T19:26:55.924144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00114/citation-record","integrity":"/paper/2501.00114/integrity","json":"/paper/2501.00114/citation-record.json","paper":"/paper/2501.00114"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.998640Z","title":"Li, et al., Recent advances in end-to-end automatic speech recogni- tion, APSIPA Transactions on Signal and Information Processing 11 (1) (2022)","venue":null,"work_id":"ee631779-7442-4cd0-bafc-bf8761fb26f4","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.240662Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:35516fb4fbd5811e0990498f42887cffe16841cba63dcdf54347e27237190dcd","observation_id":"064d8f14-b9bf-40c5-9927-67be6a01f4e3","resolution":{"observed_at":"2026-08-10T23:05:41.004490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09249","last_updated":"2020-05-02T11:04:49Z","snapshot_observed_at":"2026-08-15T12:27:19.803259Z","submitted_at":"2020-04-20T12:59:07Z","title":"CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09249","snapshot_observed_at":"2026-08-10T23:05:39.246159Z","title":"Watanabe, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.246159Z"},"links":{"cited_paper":"/paper/2004.09249","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:e4fc57674e8419ebc0a980b57c60f07dd9d232ddb991844ce99f0956645851e5","observation_id":"32956857-4de7-4dd7-8700-e2a82fc35d4d","resolution":{"observed_at":"2026-08-10T23:05:39.246159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2023-1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.869626Z","title":"Cornell, M","venue":null,"work_id":"b706c182-6266-4f8e-843c-93da118fba3a","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.257344Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:d45daa08c6e661565da9bcd123fdaacb2b30949e19084e1dd29a6d9b0ac5fc90","observation_id":"22b1ebc8-e1f4-42d9-904b-64532d14a419","resolution":{"observed_at":"2026-08-10T23:05:39.874834Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2024-1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.853689Z","title":"Cornell, T","venue":null,"work_id":"31c8c77c-194e-4de2-9304-99179145e8fb","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.262373Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:518d400fda59a0910a882b29f814ad41b96a39c42ac902446fde78dfe1bb0d68","observation_id":"d1c7eb07-7f28-42e5-ab5f-f6de6af44305","resolution":{"observed_at":"2026-08-10T23:05:39.858789Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03930","last_updated":"2025-02-24T19:37:06Z","snapshot_observed_at":"2026-08-14T14:25:15.221789Z","submitted_at":"2024-10-04T21:13:58Z","title":"Reverb: Open-Source ASR and Diarization from Rev","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03930","snapshot_observed_at":"2026-08-10T23:05:39.267220Z","title":"Bhandari, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.267220Z"},"links":{"cited_paper":"/paper/2410.03930","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:528cade7701ed4a1feb14591fe5204f153bc3627255f2c985337bf8d15d31e63","observation_id":"0c7488d4-f5f3-41a7-b7a5-3d0814f8b844","resolution":{"observed_at":"2026-08-10T23:05:39.267220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.272963Z","title":"Yoshioka, I","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.272963Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:129a3c618cea370df2884c5ae5a88a32083dc11df3c696bd50518e2f55e3999f","observation_id":"767fc39e-7eca-43f1-8009-0529e75d2908","resolution":{"observed_at":"2026-08-10T23:05:39.272963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.278318Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.278318Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:a9eb19bc1b70374b6ba0dbdddc113738147d7d44295ba126359b4263d00324a2","observation_id":"304020ac-f9d4-48b3-9bb7-6a1073c03209","resolution":{"observed_at":"2026-08-10T23:05:39.278318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2019-1126","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.731187Z","title":"Kanda, S","venue":null,"work_id":"d5d281b5-3324-479b-9fb5-05c863efafd1","year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.283271Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:587dbf5a0d643f44873418582db0ce79692330c666737a43eb1f5f432b960aa5","observation_id":"b7b9c6ee-0edb-44cf-8c62-b7e0eb06333c","resolution":{"observed_at":"2026-08-10T23:05:39.736184Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.982871Z","title":"Karafi´ at, L","venue":null,"work_id":"ffc63092-ea2f-4468-b1d9-f0b718298f30","year":2011},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.288277Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:e98f2720f9e81354889bbf8147e2744a57a70ece22c9c78aae31fe902b981592","observation_id":"35f87962-629f-464e-96b7-c05ceb8bd7d3","resolution":{"observed_at":"2026-08-10T23:05:40.987827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.298540Z","title":"Dehak, P","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.298540Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:62be1ffa3e8b25b3728a71a8d8104253b6bdc4bf7363899bec09199a723bed3c","observation_id":"84e3e55b-36ba-43e9-96cb-32072c9814f6","resolution":{"observed_at":"2026-08-10T23:05:39.298540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.304067Z","title":"Snyder, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.304067Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:52902c10a66b8ca0cc74f2bd9bacb83c1aa4116813faaf85ef88e1cc2a11e154","observation_id":"4c2d04e6-c3e5-4876-8193-d86cde3522d2","resolution":{"observed_at":"2026-08-10T23:05:39.304067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.946562Z","title":null,"venue":null,"work_id":"a33b87c8-d6a8-4a9d-a28c-4896c693a463","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.308653Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:d04446374bccb69e32d50006f6afdd4698fe9e33160344409682020c25fbf8be","observation_id":"827f3c82-fc50-4546-9bc4-dd98456e0e47","resolution":{"observed_at":"2026-08-10T23:05:40.951865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.313547Z","title":"Radford, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.313547Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:f99c3fa704f1f3a90a06e1935d3875bf2c95b15b1e4f97a96378ebfa74d018bb","observation_id":"155fe754-c5e5-48f7-9c8b-c739a4216752","resolution":{"observed_at":"2026-08-10T23:05:39.313547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.318226Z","title":"Vinnikov, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.318226Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:b6ea111447905032c6f375808736c231d52d368746799ef1367eb45aa294600b","observation_id":"647c51e5-7d89-40c4-94aa-f2270dc33c76","resolution":{"observed_at":"2026-08-10T23:05:39.318226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.920243Z","title":"Mccowan, J","venue":null,"work_id":"7c963cac-7cbb-4ec6-948a-f244a04b560a","year":2005},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.323191Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:c01bc515bd54f175ce1287b2b1fd4447abb20e43c199c4d8525b854b42898e02","observation_id":"df418fcb-55c9-4b35-8393-8095a167cfe0","resolution":{"observed_at":"2026-08-10T23:05:40.925070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.905149Z","title":"Cosentino, M","venue":null,"work_id":"220d0e78-72d9-456f-88b7-da1d9a883d25","year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.327825Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:a3e4913afa703cacd55cac4eedf35b068b1c037d89625973068614af487553fc","observation_id":"4fa9dd60-8f3c-4530-83bb-36cacd5e80ab","resolution":{"observed_at":"2026-08-10T23:05:40.909958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.888166Z","title":"Kinoshita, M","venue":null,"work_id":"36aa9f2f-98f1-459e-9cd8-81d7772c7005","year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.332251Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:53e2d2e248426ebbee01fcb5654989c395c55c2b30dbf2a19238c7993a5d6b8f","observation_id":"268b19a0-188a-4fa9-b1b1-229356d50006","resolution":{"observed_at":"2026-08-10T23:05:40.893821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.871238Z","title":"Bredin, pyannote","venue":null,"work_id":"b4163188-287c-42d8-a7b0-a76600292955","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.337358Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:02d500daa96b4bdc11d9ec8eeded68754d9c6d6a378b543bb23f33335d2259c6","observation_id":"f9552426-1895-49a1-9ebf-ec8e08e7e359","resolution":{"observed_at":"2026-08-10T23:05:40.876113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.855778Z","title":null,"venue":null,"work_id":"a5ea1654-8b9f-4e1f-881c-4520f9aa6c28","year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.342167Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:fca4d079a18f6ca8d1cad66acc848f7960a56346ac33fe26ff7a99339621f9ef","observation_id":"915eaa56-6f48-4974-a696-58313900316d","resolution":{"observed_at":"2026-08-10T23:05:40.860426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.346985Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.346985Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:e9438210a9797eafb2a1df5578c453c32cee042f09507526c11a6e00b8b2fe3a","observation_id":"920f8e37-99c2-4972-8739-03c8c28aaf66","resolution":{"observed_at":"2026-08-10T23:05:39.346985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.839257Z","title":"Kanda, X","venue":null,"work_id":"f499764b-01bd-4b39-b6af-c49e9dc87d94","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.351745Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:4254d4cb045cd6be93ccec5e940f359167f69a43581f30e9d31e1fb0499c3784","observation_id":"46125a7a-58ec-4c29-8d83-a37b6b4cf2e7","resolution":{"observed_at":"2026-08-10T23:05:40.844492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.823210Z","title":"Cornell, J.-w","venue":null,"work_id":"f8f995f5-3b80-4948-83e9-acc706e7d0b8","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.356481Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:2e4e5d94ad3910881677a340de5d411bb8e719b9a26d945a290e63022bf72d20","observation_id":"485389d2-bf9a-4cb8-93b9-ae6fa56e5b5b","resolution":{"observed_at":"2026-08-10T23:05:40.828359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.805207Z","title":null,"venue":null,"work_id":"db70ed38-1987-45f8-abe6-bff19a035610","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.361320Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:70b21af8b8452f4afae46093fa152de027c935f37a7e9580d561660d5e871fad","observation_id":"4b9b42a4-45d2-4ff2-b0ab-3cda1921a721","resolution":{"observed_at":"2026-08-10T23:05:40.811535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-971","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.692827Z","title":null,"venue":null,"work_id":"0295b945-c3d7-4a54-817f-54224d4fee34","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.366022Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:c0e80e41e28932d400f4eac9762f827a310518cfc6220756dc38428566b0ea26","observation_id":"c08df716-a03a-4c4c-9332-713c7670b5ed","resolution":{"observed_at":"2026-08-10T23:05:39.697457Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05589","last_updated":"2024-12-07T08:53:37Z","snapshot_observed_at":"2026-08-15T11:33:32.350730Z","submitted_at":"2024-12-07T08:53:37Z","title":"SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05589","snapshot_observed_at":"2026-08-10T23:05:39.370841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.370841Z"},"links":{"cited_paper":"/paper/2412.05589","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:fd7e38c974557a96995b3c6c2592ee6012d90c638c7a89741b5beb0862007ffe","observation_id":"a1bc5c05-58e3-40ef-8a58-9a3409ec2415","resolution":{"observed_at":"2026-08-10T23:05:39.370841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.376201Z","title":"Vaswani, Attention is all you need, Advances in Neural Information Processing Systems (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.376201Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:75713031bba72e31954016a1d05dcae83268298fca6cef092138c17f993ac4ad","observation_id":"70cc3420-629c-477b-b0d3-d979b0b20bf7","resolution":{"observed_at":"2026-08-10T23:05:39.376201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00430","last_updated":"2023-11-01T10:45:07Z","snapshot_observed_at":"2026-08-13T05:35:04.248097Z","submitted_at":"2023-11-01T10:45:07Z","title":"Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00430","snapshot_observed_at":"2026-08-10T23:05:39.380789Z","title":"Gandhi, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.380789Z"},"links":{"cited_paper":"/paper/2311.00430","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:0b6ecb1f447cd146f79cfb8cd2315017ebcd27369bcecda869399439151f8129","observation_id":"36578a4d-00d3-4bdf-990d-c4075d6719a1","resolution":{"observed_at":"2026-08-10T23:05:39.380789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.777806Z","title":"Watanabe, T","venue":null,"work_id":"15c17595-c162-460a-bd87-c0f2adc9fd9e","year":2017},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.385781Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:870c62415b2a0cf81a6940a4b71cf2c381dc824eaaa8200e12c0b51b121e420b","observation_id":"d9ea05b8-ec88-4549-b4db-42fcd46165d5","resolution":{"observed_at":"2026-08-10T23:05:40.782690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.390516Z","title":"Graves, S","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.390516Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:182daabb621a5d9f18bea82736ce4abf999cd870b2a4a50eb8ff12384e7a2b33","observation_id":"14bb581b-af9e-454d-807d-cd800ddfcb76","resolution":{"observed_at":"2026-08-10T23:05:39.390516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p17-1048","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.677691Z","title":null,"venue":null,"work_id":"c5c33890-6451-4f8e-a3d8-1d14cf047602","year":2017},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.395342Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:34de1feaa7aea082aee6e6296e9479248d4953c871c474980350ad293ad854c8","observation_id":"c664f6a0-cc54-4345-b47d-65f0fda85b26","resolution":{"observed_at":"2026-08-10T23:05:39.682547Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.761187Z","title":"Leviathan, M","venue":null,"work_id":"e220640d-2897-415b-8e0c-9bcae7938bce","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.400009Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:290a7a1bf8051f62e7b602ca5d14eb85bdc7137bcdec71b6b085bbf4c633abf8","observation_id":"2b8c0965-e37a-4ac8-8d36-6743eb3cca85","resolution":{"observed_at":"2026-08-10T23:05:40.766481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.404816Z","title":"Watanabe, T","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.404816Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:05f834ad00ed53732309f5570ba566c190cd73b77a256a6f02992dfb349edc19","observation_id":"74d48550-f11e-4b54-9de3-ca0f308b4055","resolution":{"observed_at":"2026-08-10T23:05:39.404816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09543","last_updated":"2025-01-16T09:51:19Z","snapshot_observed_at":"2026-08-12T22:44:50.228752Z","submitted_at":"2024-09-14T21:46:00Z","title":"Target Speaker ASR with Whisper","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09543","snapshot_observed_at":"2026-08-10T23:05:39.409724Z","title":"Polok, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.409724Z"},"links":{"cited_paper":"/paper/2409.09543","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:16d904264075bb3f67c0600fd75489769cf98d54ca533169931f230a3d1d6988","observation_id":"aaf3b4a5-3456-4431-a944-2b4e940b24c1","resolution":{"observed_at":"2026-08-10T23:05:39.409724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.745067Z","title":"Horiguchi, Y","venue":null,"work_id":"4e643157-f98e-4c0d-bcf4-633258ba2382","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.415188Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:599819b62f67fa8f05785d919074514c097188d52232b7b0d77a5635c42da6e1","observation_id":"8d2631dd-c8d2-41df-aebf-961a2edc77e2","resolution":{"observed_at":"2026-08-10T23:05:40.750333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1260","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.650341Z","title":"Moˇ sner, R","venue":null,"work_id":"a697dd94-784f-4cd7-af04-ad3899635fb6","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.424979Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:abec4c79654105f41426ec8e61a9fa5f15733bf798f508f5d662ec91700753e9","observation_id":"abe155b3-d97b-4f0c-967c-08c30ff1cc3b","resolution":{"observed_at":"2026-08-10T23:05:39.655233Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.728586Z","title":null,"venue":null,"work_id":"7b725b80-4efc-4b87-8db0-033ea5d02c9d","year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.429821Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:90337f80a624fc6b7b9adb19f949d65c75e797ed03e10d257da1a7dbadd9eeda","observation_id":"f7f5c7a8-1eb3-4b13-ac36-009ffe0c954b","resolution":{"observed_at":"2026-08-10T23:05:40.733657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2023-6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.633022Z","title":null,"venue":null,"work_id":"b4b2d0f4-04a4-48fd-968d-42dd9b63733b","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.434348Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:1bffda4c44fa7a558d898ef76900e032ff41445fd8bf5ae69cd36f434c7bc432","observation_id":"a97d7c6f-48ac-44b1-aa23-5b1727c9be52","resolution":{"observed_at":"2026-08-10T23:05:39.638371Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.438872Z","title":"Panayotov, G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.438872Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:58abfe386e35707dd2966393efd08c9de09109b76cacb19b82b5cd5dc6742bdf","observation_id":"a9e2c3bb-009f-4020-b83f-1986749ab605","resolution":{"observed_at":"2026-08-10T23:05:39.438872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.710801Z","title":"Loshchilov, F","venue":null,"work_id":"8bb51ff6-c65b-4ffd-b7c8-7ea72fea29ad","year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.443694Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:869c88ebee1aeaaa4c0d5870deb28076e1f0fcb53673c0268fb20b7a48bd6134","observation_id":"bea02136-184f-498f-8de7-4a2eef6963e4","resolution":{"observed_at":"2026-08-10T23:05:40.716649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09408","last_updated":"2024-10-21T07:46:22Z","snapshot_observed_at":"2026-08-12T22:44:58.038869Z","submitted_at":"2024-09-14T10:49:06Z","title":"Leveraging Self-Supervised Learning for Speaker Diarization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09408","snapshot_observed_at":"2026-08-10T23:05:39.448626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.448626Z"},"links":{"cited_paper":"/paper/2409.09408","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:fe29014d1f5abe84e48f96d495e46b4398771dd13f9bafa3572377e9ac3fb16f","observation_id":"063e09ba-1294-49ee-a505-1d33ca8b9926","resolution":{"observed_at":"2026-08-10T23:05:39.448626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.692902Z","title":"Kinoshita, M","venue":null,"work_id":"2790b6c3-e6c1-4101-8d3b-1494f65767cf","year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.453936Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:df0aff19e76de6d15fb3e8b4274b651ffbe0c1853f6d96057491da15702896fd","observation_id":"75f7608a-70ed-4d9a-a213-99de62902823","resolution":{"observed_at":"2026-08-10T23:05:40.698315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-205","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.614976Z","title":"Plaquet, H","venue":null,"work_id":"728277b7-059f-492d-85e2-7e9a1e658685","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.458960Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:0aaee73c0c5d999231fcdf0b53858803642a427430ffedd0457a30ada07e45aa","observation_id":"d6dd8d50-ec95-42e0-b165-efc1dbe9a7d1","resolution":{"observed_at":"2026-08-10T23:05:39.620449Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.675451Z","title":null,"venue":null,"work_id":"0871b028-f41a-4d4d-ab2c-aabb24f6e883","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.463750Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:920b019322ee74408b946f71ad51a63c453a7caa9e39bdee82a9e69464b729aa","observation_id":"105ceb0c-d600-4f6c-92d6-d3c703168dd2","resolution":{"observed_at":"2026-08-10T23:05:40.680968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.659305Z","title":"Gulati, J","venue":null,"work_id":"a1b7bc00-87ad-47ed-8766-01b77c7128bc","year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.468929Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:63aacfaf85fdd8ca5ef28c7c007c207d14526f91a40aa1f0fb0ad9c6754f379e","observation_id":"287c60f7-9c73-4cb7-90ce-27639fd2dfd3","resolution":{"observed_at":"2026-08-10T23:05:40.664211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.643427Z","title":null,"venue":null,"work_id":"973901ba-a0e4-4fa2-a707-01a25871f84c","year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.473653Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:7bbfa0abb65b795fdf20f98d0d389a84b4c63eb903e0239e7e7c4d55263b5089","observation_id":"3396ec68-217e-47ac-a066-ea22f3176993","resolution":{"observed_at":"2026-08-10T23:05:40.648375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-102","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.599029Z","title":"Kanda, G","venue":null,"work_id":"fe67e459-88f8-4f70-8620-34150951faeb","year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.478262Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:6bec8522f8f2f9206c823db4c9624d1d13590165017453ac984219fcacb53bb2","observation_id":"ae081d3a-e35e-46b2-ac1c-6ef56c6c9f4c","resolution":{"observed_at":"2026-08-10T23:05:39.604033Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.482931Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.482931Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:34affeb77dde853903dbe4ef0d0f3f964df3fb6800088813631aa5e7cff746ca","observation_id":"5cb86522-9d0c-4011-bf07-c4abce2430ff","resolution":{"observed_at":"2026-08-10T23:05:39.482931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.487635Z","title":"Fazel-Zarandi, W.-N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.487635Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:5d62db59234b0d3ca55a5f9c8366ac2dcc1131e1d8ca16c4fe42055b53a565be","observation_id":"434142d1-ce75-4ae1-a8a2-8ecd4e97c5b7","resolution":{"observed_at":"2026-08-10T23:05:39.487635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2024-7","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.582826Z","title":null,"venue":null,"work_id":"b2bf7b27-dbe9-4410-9f2d-4565ff618283","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.492311Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:a8e08dad3481471854056faa2247f0774d1363654fcd4ce45a62f48f008401f5","observation_id":"2cb3fd5f-7225-4dc1-a699-318ef099bcf6","resolution":{"observed_at":"2026-08-10T23:05:39.588136Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1280","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.566291Z","title":"Zhang, Y","venue":null,"work_id":"7d846011-4fe2-42b5-963f-518164ed70a3","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.497246Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:b841f666bb1fd696bd8c17dfe4abf496e6ee107466e91213da3051be039762fe","observation_id":"e34037f9-b5a9-46ee-b6ad-83324d6cde87","resolution":{"observed_at":"2026-08-10T23:05:39.572160Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2024-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.548641Z","title":"Polok, D","venue":null,"work_id":"07ba674c-f46e-423d-b752-40e8016c04bd","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.502535Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:3c7d7673ccc719f5cec9f6f2e9b4eb453ec403d4b0f12276d34930b2ccba0ae7","observation_id":"fe38cd21-362d-4add-b66b-14ceec7fd3a2","resolution":{"observed_at":"2026-08-10T23:05:39.554991Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.626844Z","title":"Rousseau, P","venue":null,"work_id":"62b6d1fa-8e30-4a3d-82bf-ae4d0683fe58","year":2012},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.507258Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:5edce69363a8a3179d39808482dcd4c05903f3665f5796eac47ae31034818106","observation_id":"d9a75cc7-69f4-4784-b173-e625aeb79e8b","resolution":{"observed_at":"2026-08-10T23:05:40.632107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.511964Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.511964Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:726e046f9b3d62abe85f79094ddef815dc7b9563d5822cb0dc9ee2e624a46109","observation_id":"b21492c4-3325-4d8f-b264-c535d23ebf8d","resolution":{"observed_at":"2026-08-10T23:05:39.511964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.597164Z","title":null,"venue":null,"work_id":"8f634392-9357-4850-b03d-d9a35e0bd1bd","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.516845Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:d5c821177a15e0107df5bd76ffdfc1bd6abc13bee1353936b8368c8167ce9e52","observation_id":"2f3357fb-827c-49be-ae62-b639b5c11136","resolution":{"observed_at":"2026-08-10T23:05:40.603020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.419792Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":7336,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.419792Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:fea22284e79c1c547f0e5f76e4e6a9966efefd6f1c7dec1652d1643910b71821","observation_id":"a42792b0-a462-4c4d-bc6d-365c97910fa6","resolution":{"observed_at":"2026-08-10T23:05:39.419792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T08:32:25.257595Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":12,"verified_fuzzy":15},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 3 inbound Pith citation observations for arXiv:2501.00114."}