{"as_of":"2026-08-19T01:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acf39f45da1250a6ffdec587005fd9181c2c70fccb55705a4bb3721c8ad71618","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:58:27.925157Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19356/citation-record","integrity":"/paper/2507.19356/integrity","json":"/paper/2507.19356/citation-record.json","paper":"/paper/2507.19356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.469589Z","title":"Integrating emotion recognition with speech recognition and speaker diarisation for conversations,","venue":null,"work_id":"64a8e014-51fd-4d3f-be38-2bf4c331b867","year":2023},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.543398Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:174f6c14faf4e151adf0044491f04ea2f1087d6cdcda90559ef2ed1e613331d8","observation_id":"65a1ec94-ccd5-4f1a-9375-d501dab9dd1e","resolution":{"observed_at":"2026-08-15T17:58:28.544060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T17:58:27.626269Z","title":"RoBERTa: A robustly optimized BERT pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.626269Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:27f18d65ec4ae7471c300687c142fbc106d3d1c8782ed631e8365d32dc90b2c3","observation_id":"4ae37139-1c2c-42de-b31d-67004035000d","resolution":{"observed_at":"2026-08-15T17:58:27.626269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-14T22:05:39.651975Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-15T17:58:27.637936Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.637936Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:825dda283ed44a118f664666add7658243ad245baa0b9514f1aabce5c5ae818e","observation_id":"8c0807a3-afe2-4d28-ba97-8f7d905e066b","resolution":{"observed_at":"2026-08-15T17:58:27.637936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11893","last_updated":"2022-08-25T06:48:56Z","snapshot_observed_at":"2026-08-16T16:37:00.430521Z","submitted_at":"2022-08-25T06:48:56Z","title":"Cross-Modality Gated Attention Fusion for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":"2208.11893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.11893","snapshot_observed_at":"2026-08-15T17:58:28.084731Z","title":"Cross-Modality Gated Attention Fusion for Multimodal Sentiment Analysis","venue":"cs.CL","work_id":"360cc7cb-c6fb-49fc-af13-c8d89798fdce","year":2022},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.642608Z"},"links":{"cited_paper":"/paper/2208.11893","citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:9694b3833b2eae8a5e54366bc0979d1c7fe4e83412d083cea3fee2dc9535936c","observation_id":"a00965dc-6ad0-49e7-9e78-a44e24b5a903","resolution":{"observed_at":"2026-08-15T17:58:28.089107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.420544Z","title":"IEMOCAP: In- teractive emotional dyadic motion capture database,","venue":null,"work_id":"4a585763-6b98-461a-9ea0-1332b36d145d","year":2008},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.648490Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:0bfc3bb0afca2ac190364f9eb42b762d7bb16f865d1f06eed3652d0fee58b428","observation_id":"8abb5c52-f9d6-4b3e-9112-00a3efa89468","resolution":{"observed_at":"2026-08-15T17:58:28.424998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:27.653087Z","title":"WhisperX: Time accurate speech transcription of long form audio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.653087Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:1010f4044c9c0f315d548b64bd2a9c0c51f5e6d916ba1273369e540b5b147974","observation_id":"6c6fd2b4-234e-4d8e-b18e-e88208b4279a","resolution":{"observed_at":"2026-08-15T17:58:27.653087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:27.658492Z","title":"Speech emotion recognition with ASR transcripts: A comprehensive study on word error rate and fusion techniques,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.658492Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:13dfa0ff57d4ab5ffea9b9157272c78f6cf934eb6f110f85d9107fc1e6d37fa7","observation_id":"c4bae0ed-fb30-40e4-a72a-f4fa25a3730a","resolution":{"observed_at":"2026-08-15T17:58:27.658492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14083","last_updated":"2024-03-21T02:26:30Z","snapshot_observed_at":"2026-08-16T14:07:49.861040Z","submitted_at":"2024-03-21T02:26:30Z","title":"emoDARTS: Joint Optimisation of CNN & Sequential Neural Network Architectures for Superior Speech Emotion Recognition","version":1},"cited_work":{"arxiv_id":"2403.14083","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14083","snapshot_observed_at":"2026-08-15T17:58:28.003359Z","title":"emoDARTS: Joint Optimisation of CNN & Sequential Neural Network Architectures for Superior Speech Emotion Recognition","venue":"cs.SD","work_id":"54f9381b-087c-4d35-a1ac-ac5f9ffd036e","year":2024},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.662205Z"},"links":{"cited_paper":"/paper/2403.14083","citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:bd28551f4501a1f89a8544494d73a0f3b2c4a67c3f946493d9359d86f9a32baf","observation_id":"66813e96-3786-467d-9511-4e03379b63fa","resolution":{"observed_at":"2026-08-15T17:58:28.010121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.408304Z","title":"Speech sentiment analysis via pre- trained features from end-to-end ASR models,","venue":null,"work_id":"d6f61338-d8b5-4c12-86cc-b065b3397646","year":2020},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.666530Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:4ad1a0b149cf58adf7cb258830ff3f430aae496c60a757c5d305ab4b13fc4d38","observation_id":"ea78dee3-a181-4a97-94fb-15f08dc95cfe","resolution":{"observed_at":"2026-08-15T17:58:28.412577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01103","last_updated":"2025-01-02T06:52:28Z","snapshot_observed_at":"2026-08-18T09:05:26.886779Z","submitted_at":"2025-01-02T06:52:28Z","title":"learning discriminative features from spectrograms using center loss for speech emotion recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01103","snapshot_observed_at":"2026-08-15T17:58:27.670639Z","title":"Learning discriminative features from spectrograms using center loss for speech emotion recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.670639Z"},"links":{"cited_paper":"/paper/2501.01103","citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:84e8deddddc1e0361f277c8417530aa5ffff592645ee6b217525d6e1da20b1d8","observation_id":"4094e105-2344-4330-86bd-c97793158f5b","resolution":{"observed_at":"2026-08-15T17:58:27.670639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.394461Z","title":"Multimodal multi-loss fusion network for sentiment analysis,","venue":null,"work_id":"3680e46e-2e06-47c0-ad63-dcde6237d51c","year":2024},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.674919Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:bf0c60096f47b03e2042b28a1dceb1a2bb0947b29537e43fac1531490e9008ff","observation_id":"45de3c0f-aed2-4757-806d-e376c58a24bf","resolution":{"observed_at":"2026-08-15T17:58:28.399819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.380944Z","title":"Speech emotion recognition in dyadic dialogues with attentive interaction modeling,","venue":null,"work_id":"57f0343c-5a91-421e-9d6c-7d11b2c9f914","year":2019},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.679943Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:e7f7b3cbb3fc9effac1ba964dc2fdf35b9c96cc89e36e002bafc63483186d03d","observation_id":"31112366-bbc2-44f5-be01-9b8ad3113a6c","resolution":{"observed_at":"2026-08-15T17:58:28.385822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.309105Z","title":"Temporal context in speech emotion recognition,","venue":null,"work_id":"ce132c77-3764-4dab-8a6a-eba279d3011e","year":2021},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.779799Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:85b3b56c40eb4c29cb4c9129b275517bf06fb635af0e0018d241fcaa0ff7998d","observation_id":"9dded3b1-4def-439f-8428-588568e78806","resolution":{"observed_at":"2026-08-15T17:58:28.332793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.295520Z","title":"Transcribe-to-diarize: Neural speaker diarization for unlimited number of speakers using end-to-end speaker-attributed ASR,","venue":null,"work_id":"b3e64781-9f0b-413e-bae5-66259cb9e048","year":2022},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.824966Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:67e40d442a066c98624719a3764b5b9592a61ee779024332ca8cec90ed11acd0","observation_id":"8ab3af26-85b1-4931-92d5-6e9de366e262","resolution":{"observed_at":"2026-08-15T17:58:28.299558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16685","last_updated":"2022-07-14T20:38:18Z","snapshot_observed_at":"2026-08-16T17:10:25.932534Z","submitted_at":"2022-03-30T21:42:00Z","title":"Streaming Speaker-Attributed ASR with Token-Level Speaker Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16685","snapshot_observed_at":"2026-08-15T17:58:27.863490Z","title":"Streaming speaker-attributed ASR with token-level speaker embeddings","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.863490Z"},"links":{"cited_paper":"/paper/2203.16685","citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:cc53a7e45f7caba6386cbebc2202d9e2fb429c64a2b63e6f8238ef4d801e413e","observation_id":"0d1ed5e0-e93d-41d3-86b1-1d85510c30f6","resolution":{"observed_at":"2026-08-15T17:58:27.863490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.282769Z","title":"Speech emotion diarization: Which emotion appears when?,","venue":null,"work_id":"83b63678-c1de-47cd-81dd-e564c54c08d3","year":2023},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.908678Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:5dd4b7062b3990e710450883b190756663ddd7771a613a30f61bcd60f07e1b90","observation_id":"083e3fea-e673-4231-a515-c77139045883","resolution":{"observed_at":"2026-08-15T17:58:28.287116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.268943Z","title":"Meeting recognition with continuous speech separation and transcription-supported diarization,","venue":null,"work_id":"bae89d6f-fee1-4999-ab6b-cad1cb340eaa","year":2024},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.912835Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:43293d25e673e1c0ae541a4b5f1a2df109603d5011e89d20a5dc0919f613346a","observation_id":"f3862308-facf-4b79-8a18-660760e1d4c9","resolution":{"observed_at":"2026-08-15T17:58:28.273428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.254623Z","title":"pyannote.audio: neural building blocks for speaker diarization,","venue":null,"work_id":"a8c0de7b-3ac2-404c-b891-4548a70e7d82","year":2020},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.916716Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:c738ca41b359050aa2401870b19f08bec8f98f040b21523ab3be9a1416500311","observation_id":"58eb620d-d29f-4bf9-8404-c0571fff8df3","resolution":{"observed_at":"2026-08-15T17:58:28.259375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-15T17:58:27.920852Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.920852Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:3151479e1bed3403b3ffd92e7fb290d25fb11328d0a280b39f40473cda751ce6","observation_id":"c950f8c1-2d87-46f9-8716-5ef2086e7a65","resolution":{"observed_at":"2026-08-15T17:58:27.920852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:58:28.175622Z","title":"2019, Accepted at EMNLP-IJCNLP 2019]","venue":null,"work_id":"9f849e9e-24cc-404e-8671-a1565c4514ef","year":2019},"citing_paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T17:58:27.925157Z"},"links":{"citing_paper":"/paper/2507.19356"},"observation_digest":"sha256:2b5f1d4ffcd724fdafa466d30b7cbaa17326d2c5609f577b81e7c3d6b396465a","observation_id":"df8c584f-eb5a-4005-b8a8-38828189d440","resolution":{"observed_at":"2026-08-15T17:58:28.199442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.19356","last_updated":"2025-07-25T15:05:20Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T00:19:00.806477Z","submitted_at":"2025-07-25T15:05:20Z","title":"Enhancing Speech Emotion Recognition Leveraging Aligning Timestamps of ASR Transcripts and Speaker Diarization"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2507.19356."}