{"as_of":"2026-08-08T02:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54f2173277d2dbcc9440f6c0faea945c4be0370af4ea9c84d1423861b0ce3256","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:56.416700Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:54.000523Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:17:56.702242Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"cited_work":{"arxiv_id":"2505.19437","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19437","snapshot_observed_at":"2026-08-07T14:17:56.702242Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","venue":"cs.SD","work_id":"565444d4-3317-49f9-9617-a7c0d7a8a59b","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.000523Z"},"links":{"cited_paper":"/paper/2505.19437","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:e39b39efbff6952e672f1cfe6944d2c7d064266de2c4f3beb1c293182bb5380a","observation_id":"a4d2841a-34d1-4abc-8a00-52bae8c84bb5","resolution":{"observed_at":"2026-08-07T14:17:56.775310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19437/citation-record","integrity":"/paper/2505.19437/integrity","json":"/paper/2505.19437/citation-record.json","paper":"/paper/2505.19437"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"cited_work":{"arxiv_id":"2505.19437","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19437","snapshot_observed_at":"2026-08-07T14:17:56.702242Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","venue":"cs.SD","work_id":"565444d4-3317-49f9-9617-a7c0d7a8a59b","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.000523Z"},"links":{"cited_paper":"/paper/2505.19437","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:e39b39efbff6952e672f1cfe6944d2c7d064266de2c4f3beb1c293182bb5380a","observation_id":"a4d2841a-34d1-4abc-8a00-52bae8c84bb5","resolution":{"observed_at":"2026-08-07T14:17:56.775310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:00.946475Z","title":"1, the proposed RA-CLAP model is designed to learn a joint representation of speech and text through a con- trastive learning and self-distillation framework","venue":null,"work_id":"d0ad9169-28d8-4b92-9313-a6b0cff155c2","year":null},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.068751Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:1521b2ccf53536f5fc31f5e823bd7b07c9868be6bd5cc20ab12516158d2d4497","observation_id":"4fd6735a-f6ad-48e7-9a57-56f91ff8816f","resolution":{"observed_at":"2026-08-07T14:18:01.073427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:00.588248Z","title":null,"venue":null,"work_id":"b0e0993b-98ce-4ee8-8f4b-e3b9d6ae29f9","year":null},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.170786Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:a0320885b96ee9a90ebf1f9b2a566e0a9318c80fe1717fea0fd667579c469790","observation_id":"255fd815-9fcf-4735-8fdd-12a953119b6c","resolution":{"observed_at":"2026-08-07T14:18:00.833157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:00.322965Z","title":null,"venue":null,"work_id":"e4a3e331-1d38-49e4-8f81-63a8e08e80ce","year":null},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.269768Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:9caf4d94e7c9681404fd4231359ac74d2caece79a6ea967f1b6d42bfd682d4b9","observation_id":"22cfcac5-4ecd-4f32-a2f6-cd10482d2d70","resolution":{"observed_at":"2026-08-07T14:18:00.385503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:00.010364Z","title":"Multi-level knowledge distillation for speech emotion recogni- tion in noisy conditions,","venue":null,"work_id":"e1d1a438-38db-4a32-8c7b-a79d3f517dac","year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.341870Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:d196f63a4fc70e32b06ae60dbafa64c4ee14ff6e4d915fc845f7f2c2d00def8d","observation_id":"dcab4470-541c-4159-ab6e-9a460c34c306","resolution":{"observed_at":"2026-08-07T14:18:00.162738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:59.677976Z","title":"Iterative prototype refinement for ambiguous speech emotion recognition,","venue":null,"work_id":"361b2d9e-c8f6-458c-b01e-642b8b9307e1","year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.433356Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:dd9422fda0c7a1bcec9e16d7b3022fefd4fc9cbfe622619fb85462f43b37bba5","observation_id":"e2d36bc6-127e-4640-b312-de50206a9f3c","resolution":{"observed_at":"2026-08-07T14:17:59.864218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:59.425593Z","title":"Fine- grained disentangled representation learning for multimodal emo- tion recognition,","venue":null,"work_id":"a9a4a2e7-5051-4b4d-96cb-3774fd8d07df","year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.525076Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:f928f151ac0a46cafb15c44282ae63556ff12be053bc899f0d4fc5cc8b1cafae","observation_id":"8dcd976f-92b6-47d7-ba03-c5630c96c011","resolution":{"observed_at":"2026-08-07T14:17:59.534203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:59.105371Z","title":"Enhancing multimodal emotion recognition through multi- granularity cross-modal alignment,","venue":null,"work_id":"6826be37-4fe5-4b1b-8327-8f73ff3eea7f","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.622654Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:ac3a2076f681c072b815bc5588f4e8dc28528b8a840cc8551f56ecc42b4c3fd6","observation_id":"7b381f07-e144-40b8-b0d9-714a6aeccfdf","resolution":{"observed_at":"2026-08-07T14:17:59.287679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:58.822271Z","title":"Enhancing emotion recognition in incomplete data: A novel cross-modal alignment, reconstruction, and refinement framework,","venue":null,"work_id":"a3e930ab-3087-448d-ab85-d1b279e726ec","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.695780Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:40dda133d566835706829430c400c243380074b069fdc659aecf18f26fb6b4a7","observation_id":"24a5fce8-6dbb-496e-a982-5e77b7170dd9","resolution":{"observed_at":"2026-08-07T14:17:58.971264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:58.601749Z","title":"Emotion- preserving prosody anonymization network for voice privacy pro- tection,","venue":null,"work_id":"cbe1c1a4-f6be-4ae1-8fc1-743d29ab895b","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.769076Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:8115ad7b1fab87db6bd13ca7315550a0380771f218ecbc0ae9d08e7feed5baae","observation_id":"b5e1bef2-6569-419b-a241-a2292c9f7476","resolution":{"observed_at":"2026-08-07T14:17:58.689480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06055","last_updated":"2023-12-11T01:23:50Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T01:23:50Z","title":"Speaker-Text Retrieval via Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06055","snapshot_observed_at":"2026-08-07T14:17:54.860761Z","title":"Speaker-text retrieval via contrastive learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.860761Z"},"links":{"cited_paper":"/paper/2312.06055","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:5e2d0536ca5852e06e6e5c14f5cdc1c945e93e9d61713c4e3cc2cedb9bb0e637","observation_id":"7b76d34f-d7e0-4a80-be68-e6aa57a9c381","resolution":{"observed_at":"2026-08-07T14:17:54.860761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07203","last_updated":"2024-06-11T12:23:01Z","snapshot_observed_at":"2026-07-06T18:28:51.180903Z","submitted_at":"2024-06-11T12:23:01Z","title":"ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07203","snapshot_observed_at":"2026-08-07T14:17:54.955489Z","title":"Paraclap– towards a general language-audio model for computational par- alinguistic tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.955489Z"},"links":{"cited_paper":"/paper/2406.07203","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:c662b11828f61d3f82ca5c7818f45fd5816bb2c67da3c5e3b95284d17fe84fc8","observation_id":"5c13774c-0ad4-4b6f-be57-d16cd86060c4","resolution":{"observed_at":"2026-08-07T14:17:54.955489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.047419Z","title":"Prompttts: Control- lable text-to-speech with text descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.047419Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:5b55de5f04bcfc0439776b94faf788b38cc06dcfcd9a33f184725f15b0863831","observation_id":"885dc978-f9c3-4645-afed-bb1808695639","resolution":{"observed_at":"2026-08-07T14:17:55.047419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.119979Z","title":"Prompttts++: Controlling speaker identity in prompt-based text-to-speech using natural language descriptions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.119979Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:91a7ca24b4360b35be24ca8c3e5b2c88d192194ac1a433739cecbb9a6f453f52","observation_id":"2dde2d89-3f11-4d8f-8a91-71334313d05a","resolution":{"observed_at":"2026-08-07T14:17:55.119979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:58.307118Z","title":"Stylecap: Automatic speaking-style captioning from speech based on speech and lan- guage self-supervised learning models,","venue":null,"work_id":"cc732c1d-4e20-4102-b9fe-f33cb0951727","year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.198369Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:885d390aff6128f986e7169183559389679933e9fb1d2ec554160f96d8467991","observation_id":"217c859d-ace3-4f9b-935d-7b0465d73791","resolution":{"observed_at":"2026-08-07T14:17:58.439368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.282718Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.282718Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:6fec5a2d0059a6b916c7ab8cbf33a46249bc7c2d01991ca1de573ecba64f924c","observation_id":"eecc696b-4dec-42a6-86ce-e67a873841e5","resolution":{"observed_at":"2026-08-07T14:17:55.282718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.352417Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.352417Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:ba8a97072202cb78965636cd9a1e91caa837680b3b3599add05a8cd4d43608e6","observation_id":"58ce6195-63f3-4120-a029-d8cfed917ff5","resolution":{"observed_at":"2026-08-07T14:17:55.352417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.424565Z","title":"Gemo-clap: Gender-attribute-enhanced contrastive language- audio pretraining for accurate speech emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.424565Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:4b71cef8d1e569d57bc5a3bb31c151a18ce2588c04f7c4c9525d899689f5e0b7","observation_id":"1ec33af7-db3f-4148-acc8-169c6d83f315","resolution":{"observed_at":"2026-08-07T14:17:55.424565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T14:17:55.489986Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.489986Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:91c677fa418e616c00358ce395701b893482356d0e86cad5e2b9cc4ab17c9b68","observation_id":"0bf44369-fa18-4cc9-92a8-1c3955fd0b31","resolution":{"observed_at":"2026-08-07T14:17:55.489986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.585634Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.585634Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:c097475a626983f292bcaf7ef49d7e867e7a5e153855498cbd67fb39b48a6b62","observation_id":"b98c4c3d-eb89-4736-9d6d-234d00ccfc05","resolution":{"observed_at":"2026-08-07T14:17:55.585634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.683776Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (ver- sion 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.683776Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:e3eb1325f5f6c52aa7d813751b95c69b65f740615366b2217283c6f95854d22e","observation_id":"03232a1d-a6c3-40eb-88ec-7f590001e8c1","resolution":{"observed_at":"2026-08-07T14:17:55.683776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:57.898928Z","title":"Seen and unseen emo- tional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"7af008ad-569c-49d6-ae58-46c668de69fb","year":2021},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.766272Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:322559688433e152141a5b61849e4d01e1baa9e79c5272d0486fef3770c126fa","observation_id":"b41c8ce9-08fa-448e-9a36-22230ca671ba","resolution":{"observed_at":"2026-08-07T14:17:58.010603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.841134Z","title":"Toronto emotional speech set (tess)-younger talker happy,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.841134Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:24163e5192436250f17eec60f980886d70cc7bc18b6e7b7552f1588e0177972f","observation_id":"bc78f9b0-6e12-40ea-8dd1-b6dfefc3985e","resolution":{"observed_at":"2026-08-07T14:17:55.841134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.935541Z","title":"Mead: A large-scale audio-visual dataset for emotional talking-face generation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.935541Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:31f6eb88507922c7fe5ee24fa57f71a727d4346684252eebc54192ce035fef59","observation_id":"926bbc5f-94fc-49f7-98c5-5813ee848590","resolution":{"observed_at":"2026-08-07T14:17:55.935541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:57.500264Z","title":"Speaker-dependent audio- visual emotion recognition","venue":null,"work_id":"f4bc689f-548a-47b2-ac4d-b9e5012f73d8","year":2009},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.006922Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:b9a7b6cedd7a32b2020978af6fb91c05f3a2983d37b11167b6a53a163bcfc123","observation_id":"f03dea00-5445-4c91-a680-281a4ca24cea","resolution":{"observed_at":"2026-08-07T14:17:57.693973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:57.191418Z","title":"Categorical and dimensional ratings of emotional speech: Behavioral findings from the morgan emotional speech set,","venue":null,"work_id":"c8854c78-7a77-401c-8826-626c6368b869","year":2019},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.074876Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:e5c081b5eceeb8ab9e85c4631adba0a0d5add98a25a7d2d0ebb638e993d62aba","observation_id":"4d642703-dd2c-4e55-aa53-48d00d88f84c","resolution":{"observed_at":"2026-08-07T14:17:57.338662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:56.876970Z","title":"Speechcraft: A fine-grained expressive speech dataset with natural language description,","venue":null,"work_id":"c80c0e1a-1650-4dc5-8e6b-c329fdc0cd39","year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.143003Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:2e7f0b4734f47afb0517bd1e94cce3180ab45ab33431d2ef39d0dbc7f507d083","observation_id":"3f5edecf-56f6-4bc2-b46c-2e855d6fd05c","resolution":{"observed_at":"2026-08-07T14:17:57.013435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-07T14:17:56.239809Z","title":"Aishell-3: A multi- speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.239809Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:06024bcd47e4a2018f10f785e49825e46bcbf7a2428b6726b12f948bd4acb0ea","observation_id":"72b3b378-ef9c-4449-8708-5f8c65c46d46","resolution":{"observed_at":"2026-08-07T14:17:56.239809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-07T15:49:16.814852Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T14:17:56.327895Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.327895Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:eb7e72a96da73dcca0ccd0a3bb91b9a91801bc5b3cac5dc1fa83a5f03b0defc9","observation_id":"b6c69078-b779-436a-8e7e-6dc2e647e0ad","resolution":{"observed_at":"2026-08-07T14:17:56.327895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18802","last_updated":"2023-05-30T07:30:21Z","snapshot_observed_at":"2026-07-06T15:35:15.564727Z","submitted_at":"2023-05-30T07:30:21Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18802","snapshot_observed_at":"2026-08-07T14:17:56.416700Z","title":"Libritts-r: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.416700Z"},"links":{"cited_paper":"/paper/2305.18802","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:23b1b9a6097cbfe5e564d3e484c02c296c017b42965560950a5a2a79a267fffd","observation_id":"fea97d2f-3f14-46fd-8cc3-9a25b645b90f","resolution":{"observed_at":"2026-08-07T14:17:56.416700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T14:11:50.095218Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2505.19437."}