{"as_of":"2026-08-09T00:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce3d273a8d0243374b8988b5fbd8574d4b7cd90b825902ce83ceeeb640a433eb","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:33:14.007487Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:33:13.912562Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:33:14.053965Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"cited_work":{"arxiv_id":"2505.18498","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18498","snapshot_observed_at":"2026-08-07T14:33:14.053965Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","venue":"cs.SD","work_id":"82583725-9e55-44d6-b1f4-969cbfb833f7","year":2025},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.912562Z"},"links":{"cited_paper":"/paper/2505.18498","citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:89b98270d1a811a290930c8b2c05d4e3b7f61f8c46540232e32a8f41ee7d9bf4","observation_id":"1c53738c-ad4d-4cb8-b7b5-c8af21ec7dfb","resolution":{"observed_at":"2026-08-07T14:33:14.058991Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18498/citation-record","integrity":"/paper/2505.18498/integrity","json":"/paper/2505.18498/citation-record.json","paper":"/paper/2505.18498"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.354093Z","title":"Currently, SV systems that use low- dimensional speaker representations extracted from deep learning- based speaker encoders have become the dominant approach in this field","venue":null,"work_id":"42cf79d2-bf9b-4d25-8303-b8aaa2037cf1","year":null},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.908650Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:e2ec444372bcfe71bb059f32af0f26ec5a2dd03b4bdaa4ab350645f7f1bf9596","observation_id":"d272e83d-db89-464e-a96d-f5c90b0553ec","resolution":{"observed_at":"2026-08-07T14:33:14.358571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"cited_work":{"arxiv_id":"2505.18498","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18498","snapshot_observed_at":"2026-08-07T14:33:14.053965Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","venue":"cs.SD","work_id":"82583725-9e55-44d6-b1f4-969cbfb833f7","year":2025},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.912562Z"},"links":{"cited_paper":"/paper/2505.18498","citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:89b98270d1a811a290930c8b2c05d4e3b7f61f8c46540232e32a8f41ee7d9bf4","observation_id":"1c53738c-ad4d-4cb8-b7b5-c8af21ec7dfb","resolution":{"observed_at":"2026-08-07T14:33:14.058991Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.342242Z","title":"Datasets Our models are first pre-trained on the V oxCeleb [22] and then fine- tuned on the Dusha [18] dataset to evaluate the performance of SV","venue":null,"work_id":"6581353d-cea3-4740-8bdc-aeb7b3dec9b6","year":null},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.916593Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:e228dfb660b8ed87c573ada11be8c6cac833615b099b1b525f1a52db7beb7085","observation_id":"ef6aa4ac-7b3b-43de-9116-967227f13384","resolution":{"observed_at":"2026-08-07T14:33:14.346234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.331050Z","title":"Performance of the baseline system The performance of the pre-trained model on V oxCeleb1 is presented in Table 3, with the results of the ECAPA model referenced from [3]","venue":null,"work_id":"5d8d3076-62a1-46a0-b4fd-30896e2cf643","year":null},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.920331Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:e4156867af7189060ff583231d7c24a18917d5f5415f3bc0b527ae7b44d2f601","observation_id":"e4b5f3c6-29e9-4647-b9dd-79d75c8cae9a","resolution":{"observed_at":"2026-08-07T14:33:14.335678Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.319389Z","title":"We first verified that emotional utterances degrade SV performance, with cross-emotion test trails performed worse than same-emotion test trails","venue":null,"work_id":"770f5e7a-8943-4595-a661-ecb848cbcef6","year":null},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.923606Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:9123aa8509bb7f29300c317e1596c475a4e84f1ba79028993af07a35aa0ec1fb","observation_id":"51d46830-4f89-40c2-9dd7-eb89b07fa94e","resolution":{"observed_at":"2026-08-07T14:33:14.323742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.308718Z","title":"X-vectors: Robust dnn em- beddings for speaker recognition,","venue":null,"work_id":"ecf8e581-f27b-43da-98b5-98919efa07b6","year":2018},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.926783Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:8482803e8de511a283e0a161429e7b008ad6b8f3bcd2af4e39861d912e056447","observation_id":"e6b4887c-d265-4784-9cd3-313a6928f3c6","resolution":{"observed_at":"2026-08-07T14:33:14.312011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12592","last_updated":"2019-10-16T11:27:27Z","snapshot_observed_at":"2026-07-06T08:32:43.131328Z","submitted_at":"2019-10-16T11:27:27Z","title":"BUT System Description to VoxCeleb Speaker Recognition Challenge 2019","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12592","snapshot_observed_at":"2026-08-07T14:33:13.929697Z","title":"But system description to vox- celeb speaker recognition challenge 2019,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.929697Z"},"links":{"cited_paper":"/paper/1910.12592","citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:459668aeca50f292bd2bf8786ab7f97f4311823473bd42aa5f3e8497884bb83a","observation_id":"4c2a3cbe-4731-48f2-836e-011dc408225f","resolution":{"observed_at":"2026-08-07T14:33:13.929697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.296520Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification,","venue":null,"work_id":"d2caf5a3-034f-464c-806b-0ed8fa61a536","year":2020},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.933411Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:1f86e0b725b3138d6a7802193d50d775203450882f5128170c277fe40a398af0","observation_id":"acb2c15c-c308-4464-85c9-2b6052663fdb","resolution":{"observed_at":"2026-08-07T14:33:14.300839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.286451Z","title":"MFA-Conformer: Multi-scale Feature Aggregation Con- former for Automatic Speaker Verification,","venue":null,"work_id":"97ff45f2-377b-44b1-9371-1a1da28b9d24","year":2022},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.937296Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:43ee0c10e7e8aa9acaf52013e9991b6e8426218b4ce5b881a6b623bddd92a222","observation_id":"451a8d6f-545d-4d5f-966b-bf4bb031e276","resolution":{"observed_at":"2026-08-07T14:33:14.289827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.274444Z","title":"Margin matters: Towards more discriminative deep neural network embeddings for speaker recognition,","venue":null,"work_id":"e2929f15-ac6d-4dc3-987d-fd539ca85aab","year":2019},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.940222Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:6fbb9910f4a87f55303d741aae4f5016affe277caa14724dcf1019da5e9b419b","observation_id":"662e5a3b-e0d7-424e-bc6b-256c079af3e4","resolution":{"observed_at":"2026-08-07T14:33:14.279108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.264016Z","title":"In Defence of Metric Learn- ing for Speaker Recognition,","venue":null,"work_id":"ce86fca6-76f6-470e-984a-f6b338f6b676","year":2020},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.944520Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:117c874c5343d4d3887aa2a848114bf7e6fecbf8a0baf121729cb54700b013f1","observation_id":"447260bd-c7cd-4507-916b-ec3ed4f55f6a","resolution":{"observed_at":"2026-08-07T14:33:14.267645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.252591Z","title":"Multi-query multi-head attention pooling and inter-topk penalty for speaker verification,","venue":null,"work_id":"40b709b6-5299-428f-b6cd-a308e600323c","year":2022},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.948506Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:2951a87b50ec89c41fa39950ab61e63348e4d56c24260a366b1c04318f09ad07","observation_id":"49ed5cc9-3b10-4dea-a8fb-32e56cc92aeb","resolution":{"observed_at":"2026-08-07T14:33:14.256580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.239006Z","title":"Explor- ing binary classification loss for speaker verification,","venue":null,"work_id":"b327695b-4256-4d39-b1a1-5569f9cb0472","year":2023},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.952200Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:6881bfa678226793d17550f253fa3e7f9a5fee2f225b502131ea0b996ed46df4","observation_id":"ca578001-9df4-4d34-95a1-ec41e6d25e45","resolution":{"observed_at":"2026-08-07T14:33:14.242783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.227162Z","title":"Nplda: A deep neural plda model for speaker verification,","venue":null,"work_id":"293cc4ce-e647-421d-b6e7-a15da59895c3","year":2020},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.956178Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:fffd43cecf4924400fc799bd3a6522c59d5ae664e507e7483ed57f31f87fcd2c","observation_id":"6cf5c2e2-72ec-481d-a0c4-de75ad522a61","resolution":{"observed_at":"2026-08-07T14:33:14.231624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.215449Z","title":"Scoring of Large-Margin Embeddings for Speaker Verification: Cosine or PLDA?,","venue":null,"work_id":"127ac729-6ad5-4ebe-be8c-c0435f425bf1","year":2022},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.959639Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:47adb122ea5b7dce5c875cc75938b907f2f369e16112edce55ce3840a9ba3d3d","observation_id":"ca1df279-d672-42a6-8fad-01f644036535","resolution":{"observed_at":"2026-08-07T14:33:14.219413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.203449Z","title":"Attention back-end for automatic speaker verification with multiple enrollment utterances,","venue":null,"work_id":"59adc248-9940-4c65-af13-afe0afe79432","year":2022},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.962936Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:b8dba8c920a1e019b50bfc568e14f7dce155471c4beeaea1f8802ff7c1b6f92f","observation_id":"cc0dba39-3f10-4b23-a105-ad9b91c58656","resolution":{"observed_at":"2026-08-07T14:33:14.207711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.193524Z","title":"Prob- abilistic Spherical Discriminant Analysis: An Alternative to PLDA for length-normalized embeddings,","venue":null,"work_id":"933d1661-52f2-4f68-b872-26ee73df59d2","year":2022},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.966314Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:682ef8c9a298a744deb4aadb151731d1a894be36c1150f926b2e34a3227afe6c","observation_id":"8fb1c116-b121-4d24-ac15-c9e94d28bc45","resolution":{"observed_at":"2026-08-07T14:33:14.196784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.182179Z","title":"A study of speaker verification performance with expressive speech,","venue":null,"work_id":"2cb9c01a-fa1c-46dd-963c-4d1842c0c442","year":2017},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.968866Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:ba660dbff83baf92108b381989402a2aedcee1377fddad27f58abef48163cce2","observation_id":"7a8bbea9-f537-430f-9007-e5b796bfa35a","resolution":{"observed_at":"2026-08-07T14:33:14.185802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.170938Z","title":"x-vectors meet emotions: A study on dependencies between emotion and speaker recognition,","venue":null,"work_id":"5163525b-df0b-45a7-9567-14c8fc332c0b","year":2020},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.971447Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:5ea03538a2b7c92398880f3dafd6881fff5061c2d583a74c2e4e76ae13aedca6","observation_id":"975d0073-5454-4f20-b597-0ea549de3dd3","resolution":{"observed_at":"2026-08-07T14:33:14.175812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.158744Z","title":"Emotion attribute projection for speaker recognition on emo- tional speech,","venue":null,"work_id":"814a2150-d529-40d4-a6f4-1eb8ecd78d5d","year":2007},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.974634Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:b67399af054a6cf2347dfa78051d1e4896c3e98582e682d850e77afc9308fd9e","observation_id":"355036ba-0493-4a31-888b-0724812840b3","resolution":{"observed_at":"2026-08-07T14:33:14.163436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.147250Z","title":"Segment- Level Effects of Gender, Nationality and Emotion Informa- tion on Text-Independent Speaker Verification,","venue":null,"work_id":"2822f2ab-59a4-44e1-9684-97b2f8c42a90","year":2020},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.977992Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:40fd6d0872eea45d547b968337a3f4d51546211508053df6589b8ca85ed90715","observation_id":"cf971125-39da-41ee-9c76-acbc9fee0ae7","resolution":{"observed_at":"2026-08-07T14:33:14.151537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.135718Z","title":"Instance-based Temporal Normalization for Speaker Verifi- cation,","venue":null,"work_id":"1000702b-3b7c-4a05-8700-696781972eaf","year":2023},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.981024Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:1f838fa83ee39afb486600f328357e6f496b18ca4a273caa1935518fbf54667d","observation_id":"0a3ed5c0-f612-479b-98ef-9108cdf3f6e5","resolution":{"observed_at":"2026-08-07T14:33:14.139636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.124496Z","title":"Hy- brid Dataset for Speech Emotion Recognition in Russian Lan- guage,","venue":null,"work_id":"9f2a3b81-2a0e-443b-a07b-ce5f29e8121f","year":2023},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.984661Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:cd40bf681d9281cfd079b6b2c0e7eab1b3473075040d1d78c37b43f61de010eb","observation_id":"37549ff7-4e44-4184-a0a5-a54e562cd1f2","resolution":{"observed_at":"2026-08-07T14:33:14.128075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.113127Z","title":"Copypaste: An augmentation method for speech emotion recognition,","venue":null,"work_id":"98c77db3-b435-4124-a2f2-443eaf9081f0","year":2021},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.988353Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:c525b4970bf2bb34154596000882dfdf9d7fc90c22681c59fac27222af035851","observation_id":"b7d2bb8d-0695-40f2-81fd-39aa33242bf7","resolution":{"observed_at":"2026-08-07T14:33:14.116391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:13.991313Z","title":"Arcface: Additive angular margin loss for deep face recogni- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.991313Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:993cc38e5f97416b93d9973710b96fd8cf0e1899293924edeefd14bfced9cf9d","observation_id":"992077d4-9643-4452-af41-65fa8401c116","resolution":{"observed_at":"2026-08-07T14:33:13.991313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.097338Z","title":"Sur- vey on speech emotion recognition: Features, classification schemes, and databases,","venue":null,"work_id":"4b483ce7-a47a-4a16-a9a8-7974d4b161ee","year":2011},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.993871Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:aa8be951a75176c7c53c043d0ebd9871698cdf5ac9a713bc9580cb464fc395ee","observation_id":"32601c19-731e-4846-9047-ba2e1f0537ab","resolution":{"observed_at":"2026-08-07T14:33:14.100109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.087639Z","title":"V oxceleb: Large-scale speaker verification in the wild,","venue":null,"work_id":"9cbc08f7-d21e-4332-91e5-d1800cb3ce20","year":2020},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.996952Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:6e4f7012f77b6edb0457baed9e50049acb5735a3133dc6360f1e0474b2dac0e2","observation_id":"e8787bbb-9e0f-4918-a1b3-ed414dc1f771","resolution":{"observed_at":"2026-08-07T14:33:14.090707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.077559Z","title":"Re- visiting the statistics pooling layer in deep speaker embedding learning,","venue":null,"work_id":"9915836b-dc85-45c5-95cc-95c1fe968e2c","year":2021},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:13.999565Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:7b5cf2a49084fc91e323089862cbd841de0935d5b3473f888cc769583c421e8d","observation_id":"9fe6b536-cc38-4501-b8de-3d7e303c9a97","resolution":{"observed_at":"2026-08-07T14:33:14.080892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-07T14:33:14.003406Z","title":"Mu- san: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:14.003406Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:5080dd6d631d838c849526186cc690447d55cf85feb499e0e8ea1b2bf5a95988","observation_id":"da5662a4-e6e1-4ce4-a827-e6df1c00a14b","resolution":{"observed_at":"2026-08-07T14:33:14.003406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:14.066849Z","title":"A study on data augmen- tation of reverberant speech for robust speech recognition,","venue":null,"work_id":"c1046fbf-ae96-4010-afde-709fb0956e3f","year":2017},"citing_paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:14.007487Z"},"links":{"citing_paper":"/paper/2505.18498"},"observation_digest":"sha256:70334bdd5c64d4607b71b6da1c83d513a03923eade210d940af209ea541d5921","observation_id":"647e1a2e-06b3-48ff-ac2e-916d31a40bdc","resolution":{"observed_at":"2026-08-07T14:33:14.070342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18498","last_updated":"2025-05-24T04:31:12Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T14:28:21.888087Z","submitted_at":"2025-05-24T04:31:12Z","title":"Learning Emotion-Invariant Speaker Representations for Speaker Verification"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2505.18498."}