{"as_of":"2026-08-08T02:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f9d324b009c50aa68b48dce3c4b7add46f484d1b00d56d6cfcf75d876200b91","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:17:38.566540Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T16:27:37.596817Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T16:31:37.259420Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":"2508.07302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07302","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","venue":null,"work_id":"e4d08037-aa7f-4f18-8cf5-f5434910e1ee","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-07T14:31:44.422604Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2508.07302","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:3e7620a380ca38670d2fdc557138231f45f6755f2be2ca7cbe1cd6ff992f57c4","observation_id":"a8438032-1c43-4fd7-a270-741ef50b734a","resolution":{"observed_at":"2026-05-18T16:31:37.262268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.07302/citation-record","integrity":"/paper/2508.07302/integrity","json":"/paper/2508.07302/citation-record.json","paper":"/paper/2508.07302"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-05T22:17:38.247156Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.247156Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:876de7c6b69739ef4090768e7fc9b43e8bf1dadcd1e8a2a37f8070fb11e57d76","observation_id":"747a176c-8695-4ef4-a090-5eede55c3179","resolution":{"observed_at":"2026-08-05T22:17:38.247156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00993","last_updated":"2021-03-01T13:28:59Z","snapshot_observed_at":"2026-07-06T10:45:38.818760Z","submitted_at":"2021-03-01T13:28:59Z","title":"AdaSpeech: Adaptive Text to Speech for Custom Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00993","snapshot_observed_at":"2026-08-05T22:17:38.258146Z","title":"Adaspeech: Adaptive text to speech for custom voice,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.258146Z"},"links":{"cited_paper":"/paper/2103.00993","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:5aac338c911265da7b6a770fe9047fc86c2e6534575154e72e9997906c4009f1","observation_id":"cb5c16d8-bd7b-449b-8519-f84e610c92a5","resolution":{"observed_at":"2026-08-05T22:17:38.258146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.851795Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"26366589-f5e0-479b-9d13-ccd833b5474b","year":2021},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.274410Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:dd185a288a8595976018b4d3087dfa53d6ecd378b33ddbd8d9c5bb0ee4d0829d","observation_id":"d3080bf9-3ac0-430d-91a3-617464b9f6d1","resolution":{"observed_at":"2026-08-05T22:17:39.858055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.818288Z","title":"Generspeech: Towards style transfer for generalizable out-of-domain text-to-speech,","venue":null,"work_id":"6d9d0743-48ed-4790-b88a-a07096b827a5","year":2022},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.291568Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:0f8f112643c96f4d8252c5931482b4e0f8bf3513a6836e5071238c6df8cdf0f7","observation_id":"5ec9cfc4-6a90-424a-9aa4-a7ac5a171124","resolution":{"observed_at":"2026-08-05T22:17:39.826565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-05T22:17:38.301601Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.301601Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:3c59ab8e9e584434b81fb0f1e9abfa32f8cfba574673bff575585ad040c4e9e7","observation_id":"64a33c59-d966-4a47-b022-18342097d1b9","resolution":{"observed_at":"2026-08-05T22:17:38.301601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-05T22:17:38.311772Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.311772Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:6fdddb1b4d458ac567f2f72896285c571829f78b9de7c1f747bea1f41c71c43e","observation_id":"e7f00805-43b9-4391-b1f9-c4d742d2f610","resolution":{"observed_at":"2026-08-05T22:17:38.311772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13910","last_updated":"2024-09-20T21:27:13Z","snapshot_observed_at":"2026-08-06T13:30:05.328931Z","submitted_at":"2024-09-20T21:27:13Z","title":"Zero-shot Cross-lingual Voice Transfer for TTS","version":1},"cited_work":{"arxiv_id":"2409.13910","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13910","snapshot_observed_at":"2026-08-05T22:17:39.010243Z","title":"Zero-shot Cross-lingual Voice Transfer for TTS","venue":"eess.AS","work_id":"606cf45d-43e6-43a3-9722-4c9d5f40a643","year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.318698Z"},"links":{"cited_paper":"/paper/2409.13910","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:1bca0e2f32be99fc0a1c471e2efe30b0b7e936ae1f50a7d2f97cb8ce3c3db6e3","observation_id":"59f5b7dc-2217-4e9f-bb9a-e6bfae52afd9","resolution":{"observed_at":"2026-08-05T22:17:39.030809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.778532Z","title":"Multilingual video dubbing—a tech- nology review and current challenges,","venue":null,"work_id":"f8f89a2c-f0c8-48ec-81d2-e53dea79f0fa","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.325689Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:2ed1f79690133f185a7804c839f81dae275210aa65b6010622eb953185f70d89","observation_id":"605ed599-7d83-4687-81d3-bacee00df06c","resolution":{"observed_at":"2026-08-05T22:17:39.793134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14145","last_updated":"2023-06-25T06:46:36Z","snapshot_observed_at":"2026-07-30T18:10:36.735648Z","submitted_at":"2023-06-25T06:46:36Z","title":"DSE-TTS: Dual Speaker Embedding for Cross-Lingual Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2306.14145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.14145","snapshot_observed_at":"2026-08-05T22:17:38.968017Z","title":"DSE-TTS: Dual Speaker Embedding for Cross-Lingual Text-to-Speech","venue":"cs.SD","work_id":"fdcd5a3f-5dec-4017-ab39-b2548c3fe635","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.331461Z"},"links":{"cited_paper":"/paper/2306.14145","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:7cea49b10202820d4800de6d014a631172a243cefaa14c2b836e9e56a96e1ff2","observation_id":"98aae8f0-105e-4709-aba3-f3d9113366d6","resolution":{"observed_at":"2026-08-05T22:17:38.977395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.748746Z","title":"Diclet-tts: Diffusion model based cross- lingual emotion transfer for text-to-speech – a study between english and mandarin,","venue":null,"work_id":"fc7c8ae8-c9f2-4479-a478-738e1d5ec65e","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.341071Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:a90be1661504738d1b45fdf89e60517d4f2b117a33671c337b70bcc8496d4a50","observation_id":"a34f24ce-f9b9-4e55-9784-b403575276b2","resolution":{"observed_at":"2026-08-05T22:17:39.755773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-07T17:49:42.104594Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T22:17:38.347773Z","title":"Llasa: Scaling train- time and inference-time compute for llama-based speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.347773Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:262d0d772212320edaaf8d7c3813aab7dcc46f9dea6a7ea5324214fb557a62d9","observation_id":"dfd6b0ba-a7d5-4eaf-8b30-2dfe786e5db2","resolution":{"observed_at":"2026-08-05T22:17:38.347773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12612","last_updated":"2021-11-19T04:41:50Z","snapshot_observed_at":"2026-08-01T15:30:55.161032Z","submitted_at":"2021-10-25T02:47:59Z","title":"DelightfulTTS: The Microsoft Speech Synthesis System for Blizzard Challenge 2021","version":2},"cited_work":{"arxiv_id":"2110.12612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.12612","snapshot_observed_at":"2026-08-05T22:17:39.120607Z","title":"DelightfulTTS: The Microsoft Speech Synthesis System for Blizzard Challenge 2021","venue":"cs.SD","work_id":"f0a0099d-3c4f-4303-a370-c105b8b5478f","year":2021},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.360877Z"},"links":{"cited_paper":"/paper/2110.12612","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:15f55c9debd5bdf01c953e2f128e19d2dc1934ba36ca1c9ca839cab1a014f665","observation_id":"75e50fdd-80fb-4768-9237-e5027783d363","resolution":{"observed_at":"2026-08-05T22:17:39.128510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.714219Z","title":"iemotts: Toward robust cross- speaker emotion transfer and control for speech synthesis based on disentanglement between prosody and timbre,","venue":null,"work_id":"633ba8f0-e06a-43f8-a558-918b5d4fe2ea","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.374104Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:a1c635810c25bfd1d4fa4123d35d9d2975ebb69555fc78c84aab383e7f7c1f49","observation_id":"c3cd9acd-ddc0-4b8c-aa05-0f5377f9ae59","resolution":{"observed_at":"2026-08-05T22:17:39.723619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.688093Z","title":"Zero-shot emotion transfer for cross-lingual speech synthesis,","venue":null,"work_id":"b7222713-6744-4430-93fb-8aaec74928c8","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.382804Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:e5219268c4f2f6d4ed49407bdd50b50b0597994832e1d0cc57c9f755ddd02f8d","observation_id":"ebd62e70-9ff8-444c-b5ad-d094344832c6","resolution":{"observed_at":"2026-08-05T22:17:39.694834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.650360Z","title":"Zet- speech: Zero-shot adaptive emotion-controllable text-to-speech synthesis with diffusion and style-based models,","venue":null,"work_id":"59145651-0d97-4fa9-a340-3bf1005899d0","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.396075Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:e889cf6869579ef4ea7b7fdfa447604ced020f911dda721823b6e53860a3e92a","observation_id":"ffc56a9f-a356-4bce-977d-4e0b7e8ef712","resolution":{"observed_at":"2026-08-05T22:17:39.668409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-08-05T22:17:38.408435Z","title":"Learning to speak fluently in a foreign language: Multilingual speech synthesis and cross-language voice cloning,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.408435Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:849866967507669b7c750d8641a763cbdfcaa1336a672163d418de357fbfd666","observation_id":"b5f15223-498d-4312-b7d4-6d7df3408c0e","resolution":{"observed_at":"2026-08-05T22:17:38.408435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.579975Z","title":"Metts: Multilingual emotional text-to-speech by cross- speaker and cross-lingual emotion transfer,","venue":null,"work_id":"e30c8f0e-ffc1-486c-8e96-6acb7b12b793","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.432824Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:e2858ded421b3d5dd6bc341fb08bece76d8c4e0c61b61fa539b603b3c13bd2f8","observation_id":"b563c52b-a9a8-4dd0-b931-3a11f9ffc017","resolution":{"observed_at":"2026-08-05T22:17:39.590546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.540451Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training,","venue":null,"work_id":"008625fe-aac6-4728-92ea-bc8d45ddcac9","year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.448447Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:5d1cdbdf22f5d371de4d26b29c67fb32edc6d0ed4f83d78bd082409564ce191e","observation_id":"c289e77e-be12-49de-854d-42d9081d5e61","resolution":{"observed_at":"2026-08-05T22:17:39.550878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.509497Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":"77c68de6-d662-42de-a4dd-72fba1a6e6ca","year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.455700Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:0bbadbdc329bd4f96891c3d32663d90a91517b1f6fea90e4ffd5d0da8071a557","observation_id":"f8971949-c88b-47e5-9cba-070cd6ad9ad7","resolution":{"observed_at":"2026-08-05T22:17:39.518076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.448458Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot,","venue":null,"work_id":"7e930c73-a409-4c4f-b736-b7ef59ca4b85","year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.466878Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:a8a484cd9c4e78d1b748268aa8eaacbb691e29e61e265a29a8c89723378c2580","observation_id":"6d350465-2bb9-4d84-9e98-ca93d880dd75","resolution":{"observed_at":"2026-08-05T22:17:39.465254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.616493Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":"34238212-b058-4471-adc4-602fa8c46dd1","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.476870Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:a5e70fcb8642c4f7341ceec2a7b0f2422337e75623800732b8bd5365d7c5e06e","observation_id":"fccb8667-09ba-4ccc-80fd-6853f0519b74","resolution":{"observed_at":"2026-08-05T22:17:39.626151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.367409Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":"93ef0ea6-af59-4daf-b555-8c7f69a4612e","year":2021},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.486028Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:db5bc99336a43658954f36a01b56ad224b33ecb6007c694e04e86837681d99b4","observation_id":"5007cd8a-5f5a-4b75-a446-eaf0afcbbef1","resolution":{"observed_at":"2026-08-05T22:17:39.405977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10309","last_updated":"2025-04-14T15:18:59Z","snapshot_observed_at":"2026-08-07T16:05:51.346192Z","submitted_at":"2025-04-14T15:18:59Z","title":"AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2504.10309","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.10309","snapshot_observed_at":"2026-08-05T22:17:38.818420Z","title":"AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis","venue":"cs.SD","work_id":"720409d4-649b-4039-aaaf-a64d69c4283c","year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.493215Z"},"links":{"cited_paper":"/paper/2504.10309","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:5a4431867395c60a8d28ddf6e90fe60911928788db9798be951bf055d3475e1f","observation_id":"4c753727-01f5-46c9-b865-9e959a85ceaa","resolution":{"observed_at":"2026-08-05T22:17:38.830913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.329471Z","title":"Wavrag: Audio-integrated retrieval augmented generation for spoken dialogue models,","venue":null,"work_id":"9ee78a43-9e2b-4356-acea-c4527caecce3","year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.503618Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:73010fa3c67454f7fceb79d7c27f1e38cf554a024c10d2a0b21acd977255306b","observation_id":"1e42d927-5c44-4fff-a769-f3f74672a38c","resolution":{"observed_at":"2026-08-05T22:17:39.343676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.298171Z","title":"Codec does matter: Exploring the semantic shortcoming of codec for audio language model,","venue":null,"work_id":"c14cd59e-5fd5-41a4-8e0b-30910e98b7f7","year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.511641Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:b2defa42a59c3ecc026547a74adddffda738654931fbdcc7e6dde2d97769736b","observation_id":"cccfc76b-36da-420c-b2e4-c4131e596751","resolution":{"observed_at":"2026-08-05T22:17:39.304422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.272647Z","title":"Emo2vec: Learning emotional embeddings via multi-emotion cate- gory,","venue":null,"work_id":"f28b4678-156c-45c1-a8d4-e98258b1efc0","year":2020},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.527270Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:25b18743ab9225f5bf02d47884549f277f85f03f76ed2623ced5f468b10d745e","observation_id":"ccf1bd42-12ea-41ad-adf4-7b8b96c96d3a","resolution":{"observed_at":"2026-08-05T22:17:39.279034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.252455Z","title":"Dspgan: A gan-based universal vocoder for high-fidelity tts by time-frequency domain supervision from dsp,","venue":null,"work_id":"b13355df-f1a2-4848-be6b-7641c83f43c4","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.538673Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:eb98998595dd06b2d3db010a082c1170908288b208de20c0ad5900cb9f6aeb72","observation_id":"41f923b0-f431-41f5-9199-848c59f8635e","resolution":{"observed_at":"2026-08-05T22:17:39.259195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13702","last_updated":"2024-12-19T17:36:38Z","snapshot_observed_at":"2026-07-06T20:09:10.465980Z","submitted_at":"2024-12-18T10:45:24Z","title":"Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13702","snapshot_observed_at":"2026-08-05T22:17:38.548736Z","title":"Typhoon 2: A family of open text and multi- modal thai large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.548736Z"},"links":{"cited_paper":"/paper/2412.13702","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:3532f8f69f5f6934674b014899911b6314aba00c1531e60c590d460db5f577c5","observation_id":"673bf918-60b9-4a34-b0c1-4645917f6e50","resolution":{"observed_at":"2026-08-05T22:17:38.548736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.227744Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":"a58a197f-6617-4619-afb9-0c373d31699d","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.555521Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:cbd470017829b12a75c489c9f9dcf2b4d5e81e43156e7696df7c8771cbc9cc34","observation_id":"d50a04fe-1cb7-4954-97cf-7339f98a8a42","resolution":{"observed_at":"2026-08-05T22:17:39.234880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-05T22:17:38.566540Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.566540Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:92165731a83054a215f6e5ba438ea664843e2b575536e6ef957837f749909236","observation_id":"36270e26-3b47-4623-b5ba-0d932e9939a4","resolution":{"observed_at":"2026-08-05T22:17:38.566540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":4,"verified_fuzzy":18},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2508.07302."}