{"as_of":"2026-08-06T19:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec76cf92fcd29334b9599e5a6c9e2102eb63f1ae2b3e93365822567639147f5f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:16:57.081692Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T18:28:48.480697Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2409.18512","last_updated":"2026-04-03T15:54:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T07:46:52Z","title":"Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T20:31:24.494060Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2409.18512"},"observation_digest":"sha256:3dcac72b61211e567ebd20ced413131a5e9cf89d8967cebbfad8d062ed8c7dd6","observation_id":"8c1e784a-8609-4a47-b1bb-6dc4731fc21d","resolution":{"observed_at":"2026-05-23T20:33:25.612916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T19:16:57.081692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06071","last_updated":"2025-08-14T07:56:46Z","snapshot_observed_at":"2026-08-06T19:09:23.241338Z","submitted_at":"2025-07-08T15:14:27Z","title":"MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:57.081692Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.06071"},"observation_digest":"sha256:0292a99f2906ac12207c29b76225051aff76728cfbc2a7c8da8c405640847703","observation_id":"382fc309-fb3f-43a4-85a1-672827b718f9","resolution":{"observed_at":"2026-08-06T19:16:57.081692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T14:50:04.223838Z","title":"ArXiv abs/2312.15185 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-06T14:43:42.026551Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.223838Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:27868e090633b9b6d398e04720273cb99e3243e6558384a89f3edb98b54b93f6","observation_id":"f780c7fd-ff9e-48e9-abaf-946cd67323b8","resolution":{"observed_at":"2026-08-06T14:50:04.223838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T11:50:25.414247Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22367","last_updated":"2025-07-30T04:12:14Z","snapshot_observed_at":"2026-08-06T11:50:21.820117Z","submitted_at":"2025-07-30T04:12:14Z","title":"Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:50:25.414247Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.22367"},"observation_digest":"sha256:e2af1a5d3ad23066343a1c57577fbe6923d779c38a9ee1c10a4a92557c431bbf","observation_id":"301254d5-bccf-44a0-9c29-c9adc82369e6","resolution":{"observed_at":"2026-08-06T11:50:25.414247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T11:29:41.195435Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22676","last_updated":"2025-08-05T07:29:09Z","snapshot_observed_at":"2026-08-06T11:29:36.399383Z","submitted_at":"2025-07-30T13:37:06Z","title":"Listening to the Unspoken: Exploring \"365\" Aspects of Multimodal Interview Performance Assessment","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:29:41.195435Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.22676"},"observation_digest":"sha256:4192fac94e787b4ebebcd87a449874607ddc5201703d4392e5819acfcd295208","observation_id":"fd2dd173-740f-4bdb-b45a-89eb39ad134e","resolution":{"observed_at":"2026-08-06T11:29:41.195435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-08-03T03:37:10.882228Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-19T02:41:52.996457Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.23511"},"observation_digest":"sha256:0e584a5fc7dc10e04f34798e930096aeb3a575b4491b9a7a89869aa9ebea8239","observation_id":"d904b568-df3c-4f04-9e7c-0eceb1425215","resolution":{"observed_at":"2026-05-19T02:41:59.596971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-05T22:34:43.524538Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.524538Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:d74d339fe3b08bc6c1e2208a1f6c454eedd757af34e72605cbf38d30ecd31405","observation_id":"f5dcc674-87c2-4a7e-a7b8-417df35ec02d","resolution":{"observed_at":"2026-08-05T22:34:43.524538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-05T10:36:06.444581Z","title":"arXiv preprint arXiv:2312.15185","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-06T18:04:23.478268Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.444581Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:688f0065ceeba4faf38e32db7add174f56c113550ccb72ef21b58c305879a41f","observation_id":"4f720ed5-cb13-4286-845c-a4e5e3b0d86e","resolution":{"observed_at":"2026-08-05T10:36:06.444581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T07:42:43.077644Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:b2d08af9b2131367ded28e8c63667d42e574696d90a748abc7b5427614d4383c","observation_id":"875a69b9-3d43-4033-95b0-c1a2e6d7ba3b","resolution":{"observed_at":"2026-05-18T07:46:03.634188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T20:56:37.533183Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:ce467b14388edff916f81483f97bed4ba1196ec5fadae04ea41394b5ce39c7d4","observation_id":"f2f20dca-d5f0-4a8d-8723-6e5aaa377292","resolution":{"observed_at":"2026-05-21T21:00:39.123236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-04T09:49:44.597311Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T09:49:44.597311Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:8b3182993d60748ede835e28626bc80d5bc33ff079dce326064a79c89c988dbb","observation_id":"26e9a64d-ee20-421a-8ce6-207d9ac59a60","resolution":{"observed_at":"2026-08-04T09:49:44.597311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-13T16:09:50.207908Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.28737","last_updated":"2026-06-20T22:01:30Z","snapshot_observed_at":"2026-07-13T16:09:50.024087Z","submitted_at":"2026-03-30T17:50:07Z","title":"ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T16:09:50.207908Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2603.28737"},"observation_digest":"sha256:d657302e62666cf27101ce5df136c4bcf23d5b2c791cacf25f33700f94f8ab4e","observation_id":"1235f466-957a-4462-850b-41217ba13cd5","resolution":{"observed_at":"2026-07-13T16:09:50.207908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2604.08363","last_updated":"2026-04-09T15:27:22Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:27:22Z","title":"CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:28.918204Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2604.08363"},"observation_digest":"sha256:ab7b2d5875c1d6f255c003e491c9fa9b5160f394f87a316e8012d156ce172714","observation_id":"4331fecc-4aaf-471d-a446-b8f915a6a3d1","resolution":{"observed_at":"2026-05-11T07:16:00.004189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2604.26417","last_updated":"2026-04-29T08:27:39Z","snapshot_observed_at":"2026-07-06T23:12:06.349884Z","submitted_at":"2026-04-29T08:27:39Z","title":"EmoTransCap: Dataset and Pipeline for Emotion Transition-Aware Speech Captioning in Discourses","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T13:13:49.855219Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2604.26417"},"observation_digest":"sha256:0f0e96ddf0a7cc43c43061f2302d051d6f53c591bb4875374349887328a5612c","observation_id":"c34293b0-51c8-46a8-8778-04e736d509da","resolution":{"observed_at":"2026-05-12T09:01:26.002498Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-02T05:36:23.979419Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:50d2693b3661329d17ac4857052ee906f651632ae6f44f0a82c523e1a66484fa","observation_id":"f2cdfda3-401b-417d-b4a1-06c2b5264529","resolution":{"observed_at":"2026-05-11T04:50:56.208024Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2605.19630","last_updated":"2026-05-19T10:11:10Z","snapshot_observed_at":"2026-07-06T23:30:21.283826Z","submitted_at":"2026-05-19T10:11:10Z","title":"EMO-BOOST: Emotion-Augmented Audio-Visual Features for Improved Generalization in Deepfake Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:47:45.259359Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2605.19630"},"observation_digest":"sha256:f8c74e69d142b65cf51ab7828f2dde0151ab40c9739437272fd3d7c458fe079e","observation_id":"3400357e-5d39-49d9-a2bb-3ad06fbcff50","resolution":{"observed_at":"2026-05-20T05:48:04.313900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2605.22732","last_updated":"2026-05-21T17:03:37Z","snapshot_observed_at":"2026-08-06T17:38:43.550221Z","submitted_at":"2026-05-21T17:03:37Z","title":"Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T04:54:35.815868Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2605.22732"},"observation_digest":"sha256:0414f206add62f150f429317b58c78a4c1d3e3a86aec22964b7890927356850c","observation_id":"fb0a5d89-b9d0-46f5-9587-71f8ac923026","resolution":{"observed_at":"2026-05-22T04:56:05.289172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2606.17339","last_updated":"2026-06-15T22:38:36Z","snapshot_observed_at":"2026-07-06T23:52:57.359941Z","submitted_at":"2026-06-15T22:38:36Z","title":"SpeechDx: A Multi-Task Benchmark for Clinical Speech AI","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-27T03:09:07.295810Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2606.17339"},"observation_digest":"sha256:008452c465c548411ffd2389010b4679fa26507e622db4ccb67b2862d9d5d751","observation_id":"a1f077c2-ab30-4e47-8e9c-e03bb13a4806","resolution":{"observed_at":"2026-07-03T18:28:48.482501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2606.31128","last_updated":"2026-06-30T04:46:45Z","snapshot_observed_at":"2026-08-06T13:27:09.813532Z","submitted_at":"2026-06-30T04:46:45Z","title":"UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T04:05:27.343684Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2606.31128"},"observation_digest":"sha256:fe39e16adbc1b044390b708f6505dc00680e93f308a1aad3cf1e42e1ed078174","observation_id":"e9feee97-ee97-4e78-a2f2-09a872113081","resolution":{"observed_at":"2026-07-01T11:45:46.191735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":189,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:32a9d1ae92d8b0d2e880b02e6b8b125b72f20c44e62474cac1ea7b3c1cd7d217","observation_id":"0f87d94c-cb0a-4502-9e79-0d9d381219bf","resolution":{"observed_at":"2026-07-01T11:45:47.155193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-01T07:12:11.459753Z","title":"arXiv preprint arXiv:2312.15185 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-03T11:55:30.881091Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.459753Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:038f1320a1d282b4a1ee1310f4aab1431b0edbfb03582f987d3b7bb7478a1646","observation_id":"e98932ef-6fc6-4774-b43e-c1653e5faa6c","resolution":{"observed_at":"2026-08-01T07:12:11.459753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.15185/citation-record","integrity":"/paper/2312.15185/integrity","json":"/paper/2312.15185/citation-record.json","paper":"/paper/2312.15185"},"outbound":[],"paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2312.15185."}