{"as_of":"2026-08-18T14:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27b45e61e688004f2d53137c13b71ce2048a0aee8799d2b03d20ef91c1fb16bf","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:35:09.308182Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12597/citation-record","integrity":"/paper/2505.12597/integrity","json":"/paper/2505.12597/citation-record.json","paper":"/paper/2505.12597"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:08.960163Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.960163Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:f130e8c574a72ed698b9637b11d9b3a5630b292b6e63e7fb814ce3f62a873865","observation_id":"ae5e58f0-03d1-4346-a055-802cb183332d","resolution":{"observed_at":"2026-08-15T20:35:08.960163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:08.967705Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.967705Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:8da7898e7513fd7f90b76903747ac4ed648ac0b8807d295867cb4591cca8f998","observation_id":"6409d19f-3b55-48d2-87e4-622526bfb733","resolution":{"observed_at":"2026-08-15T20:35:08.967705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.636010Z","title":null,"venue":null,"work_id":"a9445093-a9c4-48f8-bf95-7e24be20b820","year":2021},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.977202Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:575acabc029debed961e613c2dc916712b18b7dcb2a10d42ddb786275c1f531c","observation_id":"09bc8a9c-ec9f-4e2a-b5b0-e8e24d2f5a2a","resolution":{"observed_at":"2026-08-15T20:35:10.646922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T20:35:08.985545Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.985545Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:f300ad944fa8ae30efc25fbe37650a5063820fbfbfd8c096ec19e44e9d96dd3c","observation_id":"72e8507c-a362-4953-b617-07b8a5c1d75f","resolution":{"observed_at":"2026-08-15T20:35:08.985545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.601720Z","title":null,"venue":null,"work_id":"9e6dc1d5-9c5b-49ba-85e3-3ab3bbe7b459","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:08.994140Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:26f3814e2a6e1fa17c678c1383630987535409be8678229833fde2852488abcd","observation_id":"052230bd-327f-417c-a3b9-9cf3fe48c31a","resolution":{"observed_at":"2026-08-15T20:35:10.611767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-15T20:35:09.001537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.001537Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:edec1c9b728fd9f4fdfd633282d4ef3ad7cad79f0b4a85e6f131006d99bc971e","observation_id":"90e12740-26e9-443c-96cb-39f7a57ca83c","resolution":{"observed_at":"2026-08-15T20:35:09.001537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.011603Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.011603Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:a26f14c2f1f58794856ad5970941bfa4114b7d928776740095b632364dc2ed9e","observation_id":"0b4f0f68-8f82-411e-aefa-e840f1812c7c","resolution":{"observed_at":"2026-08-15T20:35:09.011603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1428","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.460006Z","title":null,"venue":null,"work_id":"e89a4654-63cf-47b9-a239-582fcdc7f7a9","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.027141Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:ba01affc2dd8fb4181d3d2ab4a6eb0a017e4944ddda01232a8ba3a2a38c304c2","observation_id":"af5f3f72-0113-445e-8928-2fc4a699b899","resolution":{"observed_at":"2026-08-15T20:35:09.466550Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.552757Z","title":null,"venue":null,"work_id":"7619f4e9-a605-44af-939c-ba2cc5259a93","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.035478Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:474aa2e5bf1f1ca3b0570f8ea44f2ec035c1587d932e6a3d2da4a63bc3b4ea3b","observation_id":"3861db62-1acd-4612-9da2-66096d02e633","resolution":{"observed_at":"2026-08-15T20:35:10.558146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.045829Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.045829Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:6eef4bfc10b0643514446db5f7293ceb7f27194a1f237d46f65b66dd313927c5","observation_id":"7a787d59-741f-4955-82ce-d974d43b1bac","resolution":{"observed_at":"2026-08-15T20:35:09.045829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.500625Z","title":null,"venue":null,"work_id":"0753374c-649a-4b3c-b9b2-2a1a8fe8a73c","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.055204Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:8323b3ce02c0de566665d6c8677534cd35612b25734cd2da1559410361e15c62","observation_id":"8566b159-294f-4389-8b42-9c01aaff301b","resolution":{"observed_at":"2026-08-15T20:35:10.505488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.062445Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.062445Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:4b1e0a4b2002d8a8ed9c0e9bdc98456ccf7e2a685921646ff881f7a3bc0ad9aa","observation_id":"3c89afce-a0b6-4fad-86ee-e1758a20f5c1","resolution":{"observed_at":"2026-08-15T20:35:09.062445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.448408Z","title":null,"venue":null,"work_id":"9058ac4f-a232-46df-91eb-8d33a43e7294","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.068899Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:fa8fdd98f33bc3625d1fb25dee5812572724be1613bea4229d3c1f28975aed58","observation_id":"290739a4-6f00-4403-b9e1-f3abbd42c752","resolution":{"observed_at":"2026-08-15T20:35:10.463471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.423759Z","title":null,"venue":null,"work_id":"73a95251-36aa-4e7e-8c08-98411d9f7249","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.074744Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:2ea52ad24022fa535b47775ff89121bc9e2ab3e1cb4993d2af492cba5cf608f6","observation_id":"bcd9ec48-c036-49ee-b09f-f2b4ca8b2e99","resolution":{"observed_at":"2026-08-15T20:35:10.432740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.399147Z","title":null,"venue":null,"work_id":"97788d18-4916-42d9-b07f-2970a280dba6","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.083856Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:a9e990d30179b9717226cc271c214c09e47979e697bcdd6e79bb8a03920255a4","observation_id":"342abdd9-2457-45b3-9d3c-3c3846fa8420","resolution":{"observed_at":"2026-08-15T20:35:10.404876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.360399Z","title":null,"venue":null,"work_id":"834dc076-2227-4fd2-8670-428fdda8e58a","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.092236Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:fac125533b77befc31e4073b5748338c0d5d72b080be5e92595283ef606ad65a","observation_id":"04f72e2c-c816-4b53-9300-ea24b0799737","resolution":{"observed_at":"2026-08-15T20:35:10.376420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.340253Z","title":null,"venue":null,"work_id":"cbfcc685-8bea-4eda-a59f-3db049365fe9","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.102166Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:b6b17e9235c4c3e0e348fa25e7d9457d8236fca94efbfb529e4e5731c8b82dba","observation_id":"c9dab023-8573-4b0f-a375-fa78cfff497e","resolution":{"observed_at":"2026-08-15T20:35:10.345252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07218","last_updated":"2024-04-10T10:05:16Z","snapshot_observed_at":"2026-08-16T15:16:18.193848Z","submitted_at":"2023-07-14T08:21:25Z","title":"Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07218","snapshot_observed_at":"2026-08-15T20:35:09.112409Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.112409Z"},"links":{"cited_paper":"/paper/2307.07218","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:604de6562706a8da6b2fc9ad49b1487d22458883fbe629d0481ffb76ad4aa56a","observation_id":"ddf68caa-924b-4436-8be3-1522db9fd80c","resolution":{"observed_at":"2026-08-15T20:35:09.112409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07969","last_updated":"2024-06-12T07:49:21Z","snapshot_observed_at":"2026-08-16T13:43:52.089811Z","submitted_at":"2024-06-12T07:49:21Z","title":"LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07969","snapshot_observed_at":"2026-08-15T20:35:09.120769Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.120769Z"},"links":{"cited_paper":"/paper/2406.07969","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:7d7e9de53ac86b7781a360870b350d15a455f71b06196342117b915ef621658c","observation_id":"f25ca859-113b-45ab-be92-2fa7fbc5aff1","resolution":{"observed_at":"2026-08-15T20:35:09.120769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05706","last_updated":"2024-11-28T01:10:49Z","snapshot_observed_at":"2026-08-16T14:20:12.870542Z","submitted_at":"2024-02-08T14:35:09Z","title":"Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05706","snapshot_observed_at":"2026-08-15T20:35:09.129467Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.129467Z"},"links":{"cited_paper":"/paper/2402.05706","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:7b1e6e66e43dfe43b1dd38d3bb96e8bd714025ae660582ec3b4100b0116252b6","observation_id":"9daea345-5ca3-45fc-9e0a-eb44fcc4d76c","resolution":{"observed_at":"2026-08-15T20:35:09.129467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.136192Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.136192Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:e60e413d262d48eb64ec8b90d11a20a340cf8bb035ff6002d16605ba3c7a9d9f","observation_id":"84fb09ab-4d60-4217-ad46-6f559a93dd0c","resolution":{"observed_at":"2026-08-15T20:35:09.136192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.284094Z","title":null,"venue":null,"work_id":"ab50d541-2fe5-475a-b32a-e4ad3f3608bf","year":2020},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.143137Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:40cea364c86c150133f6aefbcc766c71df668cdaccebaa67c588bcbcbe7a03db","observation_id":"e0060550-d73f-472b-99e7-7411a283bb40","resolution":{"observed_at":"2026-08-15T20:35:10.292571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.257798Z","title":null,"venue":null,"work_id":"201b4340-4efb-4888-b58c-f6f48969689e","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.149304Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:d2d1f30020d3976c8a399aa142ef20c7d470d2825da1aacb20a8965b526307ab","observation_id":"23b5998c-79cd-425f-9132-a8fbab975011","resolution":{"observed_at":"2026-08-15T20:35:10.263124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.03055","last_updated":"2016-06-10T22:03:28Z","snapshot_observed_at":"2026-08-18T08:07:19.169334Z","submitted_at":"2015-10-11T14:04:57Z","title":"A Diversity-Promoting Objective Function for Neural Conversation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.03055","snapshot_observed_at":"2026-08-15T20:35:09.157532Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.157532Z"},"links":{"cited_paper":"/paper/1510.03055","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:108babe26d8088ee0e6a14c84bb96ddd27582be88c2df324e08628253cee1657","observation_id":"661acce7-0c14-4e54-80d2-eb2490f43e65","resolution":{"observed_at":"2026-08-15T20:35:09.157532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01495","last_updated":"2025-05-07T13:05:04Z","snapshot_observed_at":"2026-08-16T13:13:23.795289Z","submitted_at":"2024-10-02T12:45:09Z","title":"OV-MER: Towards Open-Vocabulary Multimodal Emotion Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01495","snapshot_observed_at":"2026-08-15T20:35:09.164163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.164163Z"},"links":{"cited_paper":"/paper/2410.01495","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:1b2cb087971bf80e718d08f63f6277cb4a4a2bf70a4317dbf0e5ef030136c969","observation_id":"4ecb5401-b47e-4399-9825-5412c6dafa06","resolution":{"observed_at":"2026-08-15T20:35:09.164163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.232466Z","title":null,"venue":null,"work_id":"537f4378-349a-407f-ac28-cc24b9887aa9","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.169932Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:a2f8e07bc9f13a7f7b6696d6c8b35697a83118d2ca1dfa8fd179104e29863ddf","observation_id":"4818460f-74e7-4b60-b2df-470a071c069c","resolution":{"observed_at":"2026-08-15T20:35:10.242731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.204197Z","title":null,"venue":null,"work_id":"0419cf98-16e2-4530-96c8-dc3d0e50cc87","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.180889Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:5a25de855a038351c7b3d9c8f31749e9da846278b90a3a2ff8d229b377443e57","observation_id":"c250e613-1fca-485e-b1f5-06f0858b39eb","resolution":{"observed_at":"2026-08-15T20:35:10.211795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.171590Z","title":null,"venue":null,"work_id":"9790a453-aec2-4764-ac27-f17a62b55da0","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.187867Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:49f711a8c4de3e21c62047d1aca90c8731149326ad698343c8bf2c9748aedeae","observation_id":"2c2dac6c-502b-4542-8bc7-5ba4c38a7982","resolution":{"observed_at":"2026-08-15T20:35:10.182529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.146953Z","title":null,"venue":null,"work_id":"bc5d2d44-e2c4-4cfa-8eaf-e88d19492103","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.197429Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:a86716ab33c0e93746328628d182853e008ca028807354de68fd2ce973dd566c","observation_id":"f2128cd9-b8a7-492d-8622-d3d181b17db1","resolution":{"observed_at":"2026-08-15T20:35:10.154278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-15T20:35:09.206229Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.206229Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:231ed4ead80d306b937ed52c4d86ec57beeecdd3e2bfdbfe4d7fc67bf0576f8a","observation_id":"5381c12b-3e5b-459b-b08c-a135c30f2813","resolution":{"observed_at":"2026-08-15T20:35:09.206229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.212575Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.212575Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:bbbd2e26cbae91ea4d7486f5756dc2e7ec23491d5c12eedf0820871d5e47d5fc","observation_id":"eff4ed8e-3c28-4211-b36d-a0a579300c0c","resolution":{"observed_at":"2026-08-15T20:35:09.212575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.126543Z","title":null,"venue":null,"work_id":"611863c0-e11c-4056-b2c4-abacc1997899","year":2016},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.218883Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:b2c394278d1fc8eca3bc1a9b6f43ee5c9936c944bf2f740519a6f9ccdf1f23c6","observation_id":"513a7016-5a73-4aa6-a4e8-dfe475672083","resolution":{"observed_at":"2026-08-15T20:35:10.131715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.099815Z","title":null,"venue":null,"work_id":"4871bbd2-d5f6-468b-84d6-336b9b15ee14","year":2007},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.225707Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:f1779cb36e56b9e14c24023407d726e9de2fded16b5c41decde52ed69f4a6569","observation_id":"9d08bf7c-8886-45df-bf3e-f7e27e75e283","resolution":{"observed_at":"2026-08-15T20:35:10.106727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.077668Z","title":null,"venue":null,"work_id":"91b17a11-5539-4b59-a417-6168a8b11db6","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.232870Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:18f9f7a7f9ef76bda161efdf4da0c7bb061c987183361a483f72746dc5710460","observation_id":"d9977433-5100-4220-8b89-58ce33f24bc4","resolution":{"observed_at":"2026-08-15T20:35:10.085317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:10.043924Z","title":null,"venue":null,"work_id":"fa532ed9-3505-4ff4-be39-9658c42d6247","year":2022},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.240599Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:23abd1b58a81edb8bde612ea08876aadd7f36efa6505a193090697e05d851483","observation_id":"2dd36ac2-1e86-446e-a0c5-ff68e7140166","resolution":{"observed_at":"2026-08-15T20:35:10.054942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.246706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.246706Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:e39a58570ad3b1cf069da66a89bf6b392bb11c6066c27c360bc57e0e9dcbc37c","observation_id":"a6264e87-526f-4abe-9fd6-b1897fabfcee","resolution":{"observed_at":"2026-08-15T20:35:09.246706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.251906Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.251906Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:fdb81452701d639584ed7bbc2874f65b22e3d3c14044d7cadf094c6a4d7e34c5","observation_id":"17d98a7d-415a-4cdc-a503-544fc1431829","resolution":{"observed_at":"2026-08-15T20:35:09.251906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.999014Z","title":null,"venue":null,"work_id":"5e8ead22-4f16-4e1e-934c-0ca1e1682fad","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.257213Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:8bcc886849c5e73a8b40f38b04370f3a0d3fd8039fbde8d898505c84c006707e","observation_id":"1ecbe796-3b91-48e4-a023-59ce90f95e29","resolution":{"observed_at":"2026-08-15T20:35:10.007664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i17.29902","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.402866Z","title":null,"venue":null,"work_id":"cff096f1-1e79-43b1-844d-b6de62fd3796","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.265484Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:c191c82c36f9efb811eaffc954c4a6fdf675b01958542f5841efd17660249326","observation_id":"10ba1b14-69a6-4419-aae6-79cbb382c351","resolution":{"observed_at":"2026-08-15T20:35:09.416747Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.965565Z","title":null,"venue":null,"work_id":"22715a60-c9a5-4d7e-b989-b638f94f9b43","year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.271929Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:473610147fbb823ef0085a2a4258649469c9c1b57ce11fe10b165a859b518d9e","observation_id":"75da115d-3de1-45a7-9744-4d92a234a9ea","resolution":{"observed_at":"2026-08-15T20:35:09.974745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.931261Z","title":null,"venue":null,"work_id":"c4b06e36-97b1-458b-b3bb-e86c2fda447e","year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.277919Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:cb0ca62b1eabfb85dbcfdfc9c01adab50ad5387f23ee6f7114c922d8bdd7dda0","observation_id":"709a7201-9fd7-4612-b282-45c6fa2ccee5","resolution":{"observed_at":"2026-08-15T20:35:09.938624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.285624Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.285624Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:a0b23da14991c95c62ff5c32f0aec80a70b6e05445b1dbd4ce5e43696e8a0dbc","observation_id":"e334ab5a-63c6-45b4-b0c6-8ca3475082ca","resolution":{"observed_at":"2026-08-15T20:35:09.285624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.292659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.292659Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:ed9f55626e63deeb46d222c8bb0c2f3944eae2fe0d96e52a5801f33e3cb88127","observation_id":"506ec9c9-a4c9-4816-83c9-6070504c19a2","resolution":{"observed_at":"2026-08-15T20:35:09.292659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19669","last_updated":"2024-10-14T12:19:44Z","snapshot_observed_at":"2026-08-18T13:55:08.057127Z","submitted_at":"2024-07-29T03:12:28Z","title":"mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19669","snapshot_observed_at":"2026-08-15T20:35:09.300807Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.300807Z"},"links":{"cited_paper":"/paper/2407.19669","citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:9b3f5f6a822eccc8420b2cc55dfb611ce07129561efffb070431ad2fc6d85309","observation_id":"1dc25a84-3d3b-4142-86fc-1da7a4cddafa","resolution":{"observed_at":"2026-08-15T20:35:09.300807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:35:09.308182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:35:09.308182Z"},"links":{"citing_paper":"/paper/2505.12597"},"observation_digest":"sha256:279f8dd5a7bcc38cb6d0893b6796bfbeee7495602491f7321f14fc62926c227b","observation_id":"10f93fe0-7955-4e98-a85b-5f4a4b1b358e","resolution":{"observed_at":"2026-08-15T20:35:09.308182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.12597","last_updated":"2025-05-19T01:24:52Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T08:07:51.966544Z","submitted_at":"2025-05-19T01:24:52Z","title":"Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2505.12597."}