{"as_of":"2026-08-08T01:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43e22b147be6e728ed38a19db0235bb5e7d88256d917250cae5d23551c07d11e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:01:29.438826Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:01:29.331354Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T01:07:00.272497Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04048","snapshot_observed_at":"2026-08-06T20:01:29.331354Z","title":"Large-scale pretrained mod- els like Whisper [14], WavLM [15], and HuBERT [16] en- hance SER robustness by leveraging extensive speech data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.331354Z"},"links":{"cited_paper":"/paper/2507.04048","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:f4ac4a1117b9b06155c2f5e7e46a2fcb131dc2570e255f3da048ec2c966d2234","observation_id":"ad2f2715-09be-4f1c-89e4-ceed8bf8eea9","resolution":{"observed_at":"2026-08-06T20:01:29.331354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"cited_work":{"arxiv_id":"2507.04048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04048","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.04048 , year=","venue":null,"work_id":"db2357a9-62e0-45ad-9878-a93ae3d0f753","year":null},"citing_paper":{"arxiv_id":"2605.11098","last_updated":"2026-05-11T18:04:33Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T18:04:33Z","title":"AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-13T01:04:54.506749Z"},"links":{"cited_paper":"/paper/2507.04048","citing_paper":"/paper/2605.11098"},"observation_digest":"sha256:9febf167e4a06c9849d4ec7711666eaa5d710d52ea02732e06f833da3c886228","observation_id":"9226301f-dbc6-4bb4-a138-ba43f41028d8","resolution":{"observed_at":"2026-05-13T01:07:00.273850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04048/citation-record","integrity":"/paper/2507.04048/integrity","json":"/paper/2507.04048/citation-record.json","paper":"/paper/2507.04048"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.773892Z","title":"this is a sound of","venue":null,"work_id":"53a109ec-5be7-4dac-bfe7-0abb0a919902","year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.327598Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:f20922014e3e0d435bb997d5927f0533f418e959cdf2cba73cf86d4c7b1d2934","observation_id":"92b8aeb1-c476-4ab4-a49c-c1763b421afb","resolution":{"observed_at":"2026-08-06T20:01:29.777066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04048","snapshot_observed_at":"2026-08-06T20:01:29.331354Z","title":"Large-scale pretrained mod- els like Whisper [14], WavLM [15], and HuBERT [16] en- hance SER robustness by leveraging extensive speech data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.331354Z"},"links":{"cited_paper":"/paper/2507.04048","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:f4ac4a1117b9b06155c2f5e7e46a2fcb131dc2570e255f3da048ec2c966d2234","observation_id":"ad2f2715-09be-4f1c-89e4-ceed8bf8eea9","resolution":{"observed_at":"2026-08-06T20:01:29.331354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.765174Z","title":"Happy” or “Sad","venue":null,"work_id":"0540bf1e-490e-4aef-b495-be1c686f8586","year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.334984Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:6f9d20da4008d22acb91c5c4a2114eb6e8827992f90ed409187280061cebba4e","observation_id":"79d52062-635a-4fc2-8219-aea16cf4813c","resolution":{"observed_at":"2026-08-06T20:01:29.768125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.757188Z","title":"excited” and “happy","venue":null,"work_id":"f45620bf-282d-4dfc-bb5a-5f76f80baa2a","year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.338492Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:4ee59886c65202f2d70af5b93beac9e0ce66cb4a2ad58f506f1c82ce25deaac5","observation_id":"670fde26-2dd7-438f-99dc-9ffda49bd000","resolution":{"observed_at":"2026-08-06T20:01:29.759674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.749087Z","title":"Integrating Acoustic Context Prompt Tuning (ACPT), CLEP-DG improves general- ization across diverse acoustic environments without additional labeled speech data","venue":null,"work_id":"9a245c0e-0d65-4cb4-a5bc-5533b43282a9","year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.341488Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:39893407db7c025124a6f32f5591f0ad6ec4090267012b490713d96d9bfb593f","observation_id":"9b8f5ce6-b8e1-4eca-8a2c-603583d0ac75","resolution":{"observed_at":"2026-08-06T20:01:29.751978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.741403Z","title":"Affective computing: A review,","venue":null,"work_id":"93194f35-46b2-466d-bdd8-e7645d37caa3","year":2005},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.344546Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:c5a3b66f6e7304a8425612ed936b69c06bdcb528efa4c968bd2ee5ade1d64c77","observation_id":"8c4ede18-eee3-4a24-a63f-310a23eb363b","resolution":{"observed_at":"2026-08-06T20:01:29.744069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.733541Z","title":"Preece, Y","venue":null,"work_id":"4569ccfb-46fe-4e7b-9f02-2716a9ed3f55","year":1994},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.347248Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:c67ae5876878b2d63ce1577ef50ebe1b146ab5acea28039895712a4fb3133275","observation_id":"99d1de42-a775-4ee7-ab23-3589916be9f4","resolution":{"observed_at":"2026-08-06T20:01:29.736494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.349695Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.349695Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:73a573a6a05f9db52fcf23e48f9d40666e2fe2624db744019e851ab774715914","observation_id":"f8212573-553b-4109-88da-8f8b7a38ef16","resolution":{"observed_at":"2026-08-06T20:01:29.349695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.352747Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.352747Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:5b1360fe8ae541abefc478157583ef3a8aa145864e1afe791958a53758866de9","observation_id":"370f554c-f3d9-4e8c-95ce-f3c59a0f963c","resolution":{"observed_at":"2026-08-06T20:01:29.352747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07203","last_updated":"2024-06-11T12:23:01Z","snapshot_observed_at":"2026-07-06T18:28:51.180903Z","submitted_at":"2024-06-11T12:23:01Z","title":"ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks","version":1},"cited_work":{"arxiv_id":"2406.07203","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07203","snapshot_observed_at":"2026-08-06T20:01:29.515425Z","title":"ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks","venue":"cs.SD","work_id":"e33108d7-ce81-44d9-9e2d-7d546b719b8e","year":2024},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.355551Z"},"links":{"cited_paper":"/paper/2406.07203","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:e1072c96952b2abf6fe7e7cf29a71f103e3fbf7460449b9ec1e112301e23318b","observation_id":"94dcbb3d-0e1a-4fbb-ab3a-f09af57abd36","resolution":{"observed_at":"2026-08-06T20:01:29.518461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07848","last_updated":"2023-12-04T06:27:50Z","snapshot_observed_at":"2026-07-06T15:42:06.758676Z","submitted_at":"2023-06-13T15:28:10Z","title":"GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition","version":10},"cited_work":{"arxiv_id":"2306.07848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.07848","snapshot_observed_at":"2026-08-06T20:01:29.502574Z","title":"GEmo-CLAP: Gender-Attribute-Enhanced Contrastive Language-Audio Pretraining for Accurate Speech Emotion Recognition","venue":"cs.CL","work_id":"0131d469-3898-4f0b-9753-4f8801513747","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.358691Z"},"links":{"cited_paper":"/paper/2306.07848","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:5627b6b3db711a55d6870b08989ff6f905fd825366a9e05f061f9752aa362032","observation_id":"4cba598e-f394-4aaa-b568-172460786805","resolution":{"observed_at":"2026-08-06T20:01:29.507173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.716435Z","title":"Cross-modal features interaction-and-aggregation network with self-consistency train- ing for speech emotion recognition,","venue":null,"work_id":"a2519afa-5275-49d8-abf5-1367c7092613","year":2024},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.361954Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:6814a681236fa4e42fe931e64aca501f36a118a8561884cc83ea3689cb92f6e2","observation_id":"dfa20ce6-0dce-4dfa-9608-140020328e92","resolution":{"observed_at":"2026-08-06T20:01:29.719068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.708682Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":"adef35d8-e6d0-48d5-8fdb-5ec23a85e929","year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.364310Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:eecaa18ba341494cbbfb3b52e3fd553c41e027f5666b282a743523678844312f","observation_id":"7797ec94-1d13-421d-a9c2-632b61bfbf16","resolution":{"observed_at":"2026-08-06T20:01:29.711360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.700835Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":"0ad91933-92de-4d58-9dad-ab9ef355d75b","year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.367220Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:821ee810f9f1d8e53bfc59d93fc8963b9261e190d09bacfa187541ba58ca2188","observation_id":"2ce0f5f2-f8ce-4c16-95f4-35219796bc82","resolution":{"observed_at":"2026-08-06T20:01:29.703426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04269","last_updated":"2023-02-08T18:59:42Z","snapshot_observed_at":"2026-07-06T14:49:48.724079Z","submitted_at":"2023-02-08T18:59:42Z","title":"Diagnosing and Rectifying Vision Models using Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04269","snapshot_observed_at":"2026-08-06T20:01:29.369990Z","title":"Diagnosing and rectifying vision models using lan- guage,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.369990Z"},"links":{"cited_paper":"/paper/2302.04269","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:698f826b673fa110dea056dc1a0c0f48dd3b98242488f0760d492451486ba89a","observation_id":"b888d2f4-3420-418e-990a-d53cfaca40a6","resolution":{"observed_at":"2026-08-06T20:01:29.369990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.693308Z","title":"Using language to ex- tend to unseen domains","venue":null,"work_id":"8edc20c7-bc2c-4435-a703-b979b7d6aa22","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.372739Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:d63694a89c4955ee4603f0c279c4120fe12eaf5ec4244b05482f754a8145fffa","observation_id":"c28a94be-cb91-447c-9971-1e4bccd0005e","resolution":{"observed_at":"2026-08-06T20:01:29.695918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.685753Z","title":"Promptstyler: Prompt-driven style generation for source-free domain generaliza- tion,","venue":null,"work_id":"f8442f47-f5fa-47d1-a452-48fd0991dfe9","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.375131Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:c816e08223a17ef69666c4307e9489824f4982148260c1fdfc93d9dbda5de36a","observation_id":"64e1a4bd-0bca-4c0e-b7af-3d4419df860d","resolution":{"observed_at":"2026-08-06T20:01:29.688417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.677468Z","title":"Dpstyler: dynamic prompt- styler for source-free domain generalization,","venue":null,"work_id":"394115b2-8f5e-4d7b-950e-e3e961213e5c","year":2025},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.377373Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:8f53d13a8f897b444793796489ded29d22f249cd1376855d371320076194e1b6","observation_id":"dff51774-32af-4eae-bbd5-54d657626344","resolution":{"observed_at":"2026-08-06T20:01:29.680801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.669854Z","title":"Whisper: Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"b8e21cb1-5661-413c-9984-fe7d99cd54fd","year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.380093Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:ba5bff1895cc77e0d3a1de43049ff50c58e1f95e8dfd4ca449b59b500e1a8d61","observation_id":"8816ffcc-4c9a-4caa-8900-cebb04616ce6","resolution":{"observed_at":"2026-08-06T20:01:29.672462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.382456Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.382456Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:c4f94d0dab2c58cfcafeb05011cc9421dbfc2f5237907abc5bed74fd892f313c","observation_id":"8fb4169a-d501-497a-b5f9-9597b10410fd","resolution":{"observed_at":"2026-08-06T20:01:29.382456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.384916Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.384916Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:03ff88f4fa90fdbe62b275e474eb54af8a33b4657aa22b0ba4b1973e9157453b","observation_id":"70ad7e6a-9751-4580-a8ab-441ee5be647c","resolution":{"observed_at":"2026-08-06T20:01:29.384916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.653251Z","title":"Wav2clip: Learning robust audio representations via contrastive learning,","venue":null,"work_id":"f0d6109f-48b3-457b-87aa-9336a9dcea12","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.387390Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:4eeda93979b68ffa63bbe7245ffe0f024b6ec6746eba9044a9779e51c2436aa9","observation_id":"01573aa2-c727-433e-883e-63f65e8768f0","resolution":{"observed_at":"2026-08-06T20:01:29.655603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.646292Z","title":"Audioclip: Ex- tending clip to audio for zero-shot learning,","venue":null,"work_id":"3211b18c-b3ee-44ba-8f57-f0d00ef0a6ab","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.390000Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:c930fb51dbb880ca2ffa6fdd4839ce64afa72ab06fe1b16098c0a8f5828cb472","observation_id":"2625ad7b-fcfd-4752-9299-1440e23b9889","resolution":{"observed_at":"2026-08-06T20:01:29.648806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.639261Z","title":"Compa-clap: Composi- tional prompts for improving audio-text alignment,","venue":null,"work_id":"3524e384-b33e-4b77-a492-11ffd3a08582","year":2024},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.392561Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:c717830e890b7b2e8ea530825ff969712d6183fa4ed4a0b65f9afb4ad2fbebe8","observation_id":"91557793-16a5-440d-985b-1a8294ce4506","resolution":{"observed_at":"2026-08-06T20:01:29.641902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.4894","last_updated":"2014-04-14T19:21:13Z","snapshot_observed_at":"2026-07-06T03:31:09.551860Z","submitted_at":"2013-12-17T19:00:50Z","title":"Deep Convolutional Ranking for Multilabel Image Annotation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.4894","snapshot_observed_at":"2026-08-06T20:01:29.395015Z","title":"Deep convo- lutional ranking for multilabel image annotation,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.395015Z"},"links":{"cited_paper":"/paper/1312.4894","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:0d6a9d856b1f1b7072f4bf2a81ec1929b033238c68038c8996db535a0f8e5483","observation_id":"cc81ca27-3f19-46a3-b1bd-790c4c42a003","resolution":{"observed_at":"2026-08-06T20:01:29.395015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.631247Z","title":"Arcface: Additive angular margin loss for deep face recognition,","venue":null,"work_id":"56d563a5-da11-4109-917f-5018ea1cc20d","year":2019},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.397824Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:16cf518d27a7515e3135e3ed0affebbd4a088939e7b34825d77da482e4f2513e","observation_id":"aa93ad76-4c87-46f2-9331-c24d3baab56a","resolution":{"observed_at":"2026-08-06T20:01:29.634308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.623698Z","title":"IEMOCAP: In- teractive emotional dyadic motion capture database,","venue":null,"work_id":"7bd5b58c-e4ba-4bdd-8a43-400961e02f8d","year":2008},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.400110Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:b16f9e82920b0fc2000c7bdae191c5a919fc1336d38a7ecb19591a29996037e7","observation_id":"d08ccacf-c164-47bd-98c7-9b4f6ed5406b","resolution":{"observed_at":"2026-08-06T20:01:29.626550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.615783Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations,","venue":null,"work_id":"64df34ce-0251-4b54-87cf-05db76d3357b","year":2019},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.402579Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:494ce902434e2237e951753b98922636906265827b4ecc41b1be66e9663909e5","observation_id":"055f513e-b28d-43f8-a98a-adbf5f065974","resolution":{"observed_at":"2026-08-06T20:01:29.618864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.608223Z","title":"MEAD: A Large-Scale Audio-Visual Dataset for Affective Un- derstanding and Emotional Expression Analysis,","venue":null,"work_id":"7e68cb92-7e96-4ed8-89a3-63b91e7ebfce","year":2020},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.405056Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:509b3491229f345aba76ea7109faa2384b7bfad4808d70d7fecf4203278153d4","observation_id":"b6872e72-4806-4a77-8d43-e4957be45e4e","resolution":{"observed_at":"2026-08-06T20:01:29.611138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.600788Z","title":"CMU-MOSEI: A Dataset for Multimodal Sentiment Analysis and Emotion Recognition,","venue":null,"work_id":"c461d94e-10fe-4b7c-81fe-aa055e5a3fc7","year":2018},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.407680Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:8372e844bc536c666ce062ce475d8a4bebce74402a38acc901591172fc961194","observation_id":"3d296c53-f88e-4c98-ac46-035dbca314f6","resolution":{"observed_at":"2026-08-06T20:01:29.603415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.592980Z","title":"Wav2clip: Learning robust audio representations from clip,","venue":null,"work_id":"eef3518c-617f-434a-b369-bd3231d11a6b","year":2022},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.410016Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:55555ad7c1a255c30d3d1fb2da02c216fc1b6a5bb2855e556eb4149b05623d21","observation_id":"d0869239-af0e-4643-b230-96a001f5cd9f","resolution":{"observed_at":"2026-08-06T20:01:29.595828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13043","last_updated":"2021-06-24T14:16:38Z","snapshot_observed_at":"2026-08-04T12:48:20.635692Z","submitted_at":"2021-06-24T14:16:38Z","title":"AudioCLIP: Extending CLIP to Image, Text and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.13043","snapshot_observed_at":"2026-08-06T20:01:29.412385Z","title":"Audioclip: Extending clip to image, text and audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.412385Z"},"links":{"cited_paper":"/paper/2106.13043","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:5ed5bf739571c26913da3fe48a1627afa8e5b077fcc1fdbf5a6eef6df8e43d45","observation_id":"3a01696e-7f0d-4ddf-99fb-bd60b513d358","resolution":{"observed_at":"2026-08-06T20:01:29.412385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08753","last_updated":"2024-07-30T18:58:01Z","snapshot_observed_at":"2026-08-07T21:08:58.215902Z","submitted_at":"2023-10-12T22:43:38Z","title":"CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08753","snapshot_observed_at":"2026-08-06T20:01:29.415153Z","title":"Compa: Addressing the gap in composi- tional reasoning in audio-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.415153Z"},"links":{"cited_paper":"/paper/2310.08753","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:db98b376a28826cef5eb6084f2a47047545e073bbf293605374d013a0a709ee5","observation_id":"ca24a637-25ba-4b48-aaa4-e835a7fa2ce1","resolution":{"observed_at":"2026-08-06T20:01:29.415153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.585071Z","title":"The Ryerson Audio-Visual Database of Emotional Speech and Song (RA VDESS),","venue":null,"work_id":"74e32976-9fee-4a5d-a629-903f0676d062","year":2018},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.418479Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:9b6a99f1eb7a65f8fb86579a90f05d789542078667b5e319271c5b10a9a9e7f7","observation_id":"770b239e-4e4b-4de8-91cf-9a3cc21ec562","resolution":{"observed_at":"2026-08-06T20:01:29.587583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.577576Z","title":"Toronto emotional speech set (tess)-younger talker happy,","venue":null,"work_id":"dea89c33-6606-43b6-96d3-4173b852a7c3","year":2010},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.420933Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:a9f673e9f986770a5c35c4309e873f2baf47eedecb4567f0fe194971294ed5b7","observation_id":"55cbc3c2-9c45-482e-8f43-e23149d54465","resolution":{"observed_at":"2026-08-06T20:01:29.580223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.569956Z","title":"SA VEE: Surrey Audio-Visual Expressed Emotion,","venue":null,"work_id":"58a6699e-e8d5-42be-b69e-22641f1e5ec0","year":2014},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.423438Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:bb6d0e1241f55d446aaf57cbc1b9316bd734d5d55d411ed29cfd4a62b192e83e","observation_id":"b01a99ee-2eac-4821-b6cc-aa66c965a4e4","resolution":{"observed_at":"2026-08-06T20:01:29.572715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.562292Z","title":"DST: Deformable Speech Transformer for Emotion Recognition,","venue":null,"work_id":"6f258115-3073-4b02-b43f-a501816491d2","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.426195Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:3ef3292e6ac505660b53afdfb4053bdb1ae80232ef736dc84737c87745b55167","observation_id":"75b1e647-c221-40d3-9a69-e280d3211535","resolution":{"observed_at":"2026-08-06T20:01:29.564895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.553344Z","title":"Tem- poral modeling matters: A novel temporal emotional modeling approach,","venue":null,"work_id":"c61dbe80-40bb-4013-b023-22a55010c3fc","year":2023},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.429206Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:344296ff8f8bf3dba62dd7bf95c076cd833615f1b44918ddfbbaf954ba4067d5","observation_id":"5f541385-8e8c-430e-b204-058de5de6653","resolution":{"observed_at":"2026-08-06T20:01:29.556456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.431567Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.431567Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:7e3c684a7b2239be9c4693d4c236113036fae618121bf19393e8d75cd3fcf9f4","observation_id":"c969f048-ef1b-4930-b924-17b2e368aec5","resolution":{"observed_at":"2026-08-06T20:01:29.431567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.540312Z","title":"Speaker-dependent audio- visual emotion recognition","venue":null,"work_id":"a0c7f31e-0ffe-4153-b7c0-59981e63fa3d","year":2009},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.434143Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:e46c53e44b2c2d9961baa4b2cab20c783414d271a52db96dc1c06f59cd8ff987","observation_id":"129db151-23ea-4960-96d6-925a35c3d28f","resolution":{"observed_at":"2026-08-06T20:01:29.543120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:01:29.531837Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"f45ecf25-13e2-4eb0-819f-a13e4c458697","year":2020},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.436495Z"},"links":{"citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:4622e352e5f13aff7347cf63033f88fc9144e529b86b5966bc9b50dd0e2b288f","observation_id":"4dd6b5c7-e19c-4e85-bd4a-1ff104e030e5","resolution":{"observed_at":"2026-08-06T20:01:29.535020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T20:01:29.438826Z","title":"Roberta: A robustly optimized bert pretraining ap- proach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:01:29.438826Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.04048"},"observation_digest":"sha256:37067f396b0acd35dbfa43f7dee5e0df52793b8eb438b36bfc7c9741096e1421","observation_id":"2d292fc6-b95e-4061-932f-ee7dd5174719","resolution":{"observed_at":"2026-08-06T20:01:29.438826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04048","last_updated":"2025-07-05T14:16:06Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T19:54:26.714625Z","submitted_at":"2025-07-05T14:16:06Z","title":"CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 2 inbound Pith citation observations for arXiv:2507.04048."}