{"as_of":"2026-08-17T12:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b37619fe55846e489b383ad4eed5ec46087eb71560f17c4273f23027301188fc","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:34:02.234077Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.16188/citation-record","integrity":"/paper/2508.16188/integrity","json":"/paper/2508.16188/citation-record.json","paper":"/paper/2508.16188"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-08-16T06:08:36.265981Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-05T17:33:56.229318Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:56.229318Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:6c7f7002b4e03b40847a35fe88333fc6b48fb81c50a3928ff69d1430ec90b486","observation_id":"3cf0d4d2-2ebe-432c-9288-0463dec14467","resolution":{"observed_at":"2026-08-05T17:33:56.229318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-16T13:36:59.551255Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-05T17:33:56.301967Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:56.301967Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:91fd41ada4a69138f60c21f5177e4cee3d890a226764aae92cf3e58d27f48346","observation_id":"13b47d6a-81c6-486f-bf1e-89fc4ff8527e","resolution":{"observed_at":"2026-08-05T17:33:56.301967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00628","last_updated":"2023-03-07T16:41:01Z","snapshot_observed_at":"2026-08-16T15:51:40.199718Z","submitted_at":"2023-03-01T16:31:01Z","title":"MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00628","snapshot_observed_at":"2026-08-05T17:33:56.409986Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:56.409986Z"},"links":{"cited_paper":"/paper/2303.00628","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:655b8f601bcf9d4d08065f5dd50e2f61c66db08218aa80c70936b656637b11d6","observation_id":"5555e9ba-1fed-44de-8d26-972ac3a39424","resolution":{"observed_at":"2026-08-05T17:33:56.409986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:06.763082Z","title":"Chang, Sungbok Lee, and Shrikanth S","venue":null,"work_id":"5bbb8d3e-7ca7-4274-a3ea-708b72b10312","year":2008},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:56.531446Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:88764d6049931ea3186c11a190e08320d29993af6112a29d92ad06aa65e4c70c","observation_id":"4ba25ac1-08ec-4c10-b491-99f59b2ecf7e","resolution":{"observed_at":"2026-08-05T17:34:06.833469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.25156","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:05.405354Z","title":null,"venue":null,"work_id":"5812b98a-b7f4-4771-b98e-c39c570d9169","year":2017},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:56.630516Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:d718448adaea82eb5457706aa9e5b1e38c5bf4f569877a4bbdadeed21eb070ce","observation_id":"75770544-4a51-430d-a404-736e0a4f1e12","resolution":{"observed_at":"2026-08-05T17:34:05.497457Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2014.23362","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:05.198418Z","title":"Cooper, Michael K","venue":null,"work_id":"38e40e90-c4e7-4a93-bb2f-d31ccd0dd973","year":2014},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:56.754534Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:2a8de3f9db8fcde0865a0dd032e95a6fd670c8de5084769ddf8c6a9ebd1ed859","observation_id":"a9401075-ec6d-4da4-9746-ba747df083ea","resolution":{"observed_at":"2026-08-05T17:34:05.244459Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.08092","last_updated":"2018-05-13T10:35:21Z","snapshot_observed_at":"2026-08-15T07:29:52.996240Z","submitted_at":"2017-10-23T05:26:32Z","title":"VGGFace2: A dataset for recognising faces across pose and age","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.08092","snapshot_observed_at":"2026-08-05T17:33:56.813807Z","title":"Parkhi, and Andrew Zisserman","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:56.813807Z"},"links":{"cited_paper":"/paper/1710.08092","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:488f6347ba939a7269b8045d02697d8713bfa78cf2415dee3211ba6bc6314969","observation_id":"31389eec-c4ee-457b-9404-3ebfc61d891b","resolution":{"observed_at":"2026-08-05T17:33:56.813807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12319","last_updated":"2025-03-07T09:30:16Z","snapshot_observed_at":"2026-08-16T13:51:25.990686Z","submitted_at":"2024-09-18T21:17:27Z","title":"Large Language Models are Strong Audio-Visual Speech Recognition Learners","version":2},"cited_work":{"arxiv_id":"2409.12319","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12319","snapshot_observed_at":"2026-08-05T17:34:05.010787Z","title":"Large Language Models are Strong Audio-Visual Speech Recognition Learners","venue":"cs.CV","work_id":"817d30b5-e7fc-4d2a-84c9-7a94c58d7b0b","year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:56.937543Z"},"links":{"cited_paper":"/paper/2409.12319","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:87028ff55fa481723e5977a8677f0ef8957972af8dc65ff30654c2e138b2166c","observation_id":"f91372ad-c0f2-4ef3-9bd6-62f32321d44d","resolution":{"observed_at":"2026-08-05T17:34:05.071696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-13T18:35:10.938726Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T17:33:57.014492Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:57.014492Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:e19d7a93b07cac9ec235f742aa39bc5b0ef3c59fa0093b9358f4add339eebdd2","observation_id":"835e4410-3f65-4d47-bf3a-bba964b3caf9","resolution":{"observed_at":"2026-08-05T17:33:57.014492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T17:33:57.132219Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:57.132219Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:c583f481a2be0ef3f4e44616d5c9b7e2697e22fa76fb916c148d918b88992baa","observation_id":"d2ba0adf-2b9a-40a9-b9e7-0599c93a6649","resolution":{"observed_at":"2026-08-05T17:33:57.132219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:57.271812Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:57.271812Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:348a3cdd1c1802d8777b3b63275015d321bc8483a75b14f1e8991470207bce0a","observation_id":"d293e247-636e-4aec-9648-e436efc70f62","resolution":{"observed_at":"2026-08-05T17:33:57.271812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T17:33:57.386825Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:57.386825Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:bb313cae373bc2a9cd7da2b66fcd48a7fee5e4ae95a5e6c98ae9fb9a765bc9c8","observation_id":"9b876059-c3de-432e-9dc2-a5cf68d9b25c","resolution":{"observed_at":"2026-08-05T17:33:57.386825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:06.660921Z","title":null,"venue":null,"work_id":"01d8853b-38c5-4728-a8c7-d4736b930c91","year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:57.569543Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:85d2effa6da36a24efabc6857a13ff7686d2af4861b200b7e49f22a1ee792e9c","observation_id":"6acc3141-b617-4c78-8483-ff80c4b596a9","resolution":{"observed_at":"2026-08-05T17:34:06.722664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T17:33:57.695783Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:57.695783Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:8edceb200978d7829fbe4e55815ac0d1e07013c7425035a368626e5231661c75","observation_id":"5caf015c-fbbf-4dcc-b68c-9331fc6c4e2a","resolution":{"observed_at":"2026-08-05T17:33:57.695783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:57.858524Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:57.858524Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:8254b1e4d864addbdff0a61a58eebbb1d181f1149a0341d1752e002fa4a02b2f","observation_id":"70b15896-bed9-4e2a-8865-9c592fdb7958","resolution":{"observed_at":"2026-08-05T17:33:57.858524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:06.446128Z","title":null,"venue":null,"work_id":"c4a367ce-fa9f-4ae1-8553-dee92ac67929","year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:57.996257Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:420aef40cb4c5b5dee7934fde4c782949c9142add8dcf2e57a117010f0a2c3f7","observation_id":"817dc1c0-57e6-4a7d-b923-1c255ea4fc10","resolution":{"observed_at":"2026-08-05T17:34:06.553435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:58.204614Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:58.204614Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:0a167e94718f0954a1a9d0296833aa58e204aaacb5eb01f6dd5271e1e74e32e6","observation_id":"7597679a-f89b-461f-9337-07358291bb03","resolution":{"observed_at":"2026-08-05T17:33:58.204614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:06.301686Z","title":null,"venue":null,"work_id":"b7873a36-4e7f-46dd-ae74-a7a519a2ea93","year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:58.384346Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:9e72b2450f583a311f83d897e2cea03ecb1d95137fadc568deb5b46594e352f0","observation_id":"2ae88353-80e5-4496-9b92-98f7dcf8b312","resolution":{"observed_at":"2026-08-05T17:34:06.383296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-08-17T11:07:54.315530Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-08-05T17:33:58.485256Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:58.485256Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:f194e2bcf27cbd91270b88922c3b76e23f947b12696b8b0fe6c1f5077d69f2b7","observation_id":"d20f6562-f71c-4c16-8d5f-bdf6236aaf4f","resolution":{"observed_at":"2026-08-05T17:33:58.485256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T17:33:58.560527Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:58.560527Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:b0816e15f5dc8525b87b3bedd123dab1380f8c2a6cc7d4a86e045de67118c8f7","observation_id":"a826c117-363f-48f4-a952-f96380c88037","resolution":{"observed_at":"2026-08-05T17:33:58.560527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-05T17:33:58.719267Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:58.719267Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:c034d7617245e9fd3661e9eaa5f17a80ff7a1f4de8ef3aa63a5ee9b4ebd8303c","observation_id":"3710c718-f85f-4bb9-8e13-35981f786184","resolution":{"observed_at":"2026-08-05T17:33:58.719267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12984","last_updated":"2023-03-23T01:27:38Z","snapshot_observed_at":"2026-08-16T15:46:04.582370Z","submitted_at":"2023-03-23T01:27:38Z","title":"LMCodec: A Low Bitrate Speech Codec With Causal Transformer Models","version":1},"cited_work":{"arxiv_id":"2303.12984","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.12984","snapshot_observed_at":"2026-08-05T17:34:04.727787Z","title":"LMCodec: A Low Bitrate Speech Codec With Causal Transformer Models","venue":"cs.SD","work_id":"88fa7cb0-5c71-43df-ab2e-a728af28fbe9","year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:58.848250Z"},"links":{"cited_paper":"/paper/2303.12984","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:d905fe2f372faf4ce117bbb8540e6af4c08ca2387bcac3968a0686497e927516","observation_id":"a4bf7298-392e-475e-9afa-343fcd91e00b","resolution":{"observed_at":"2026-08-05T17:34:04.833194Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.593","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"323b1762-03f0-4e7e-a6f9-1f8180b802d9","year":2022},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:58.952506Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:d535863b0eba7ee75d0e2c3084fd0587085f055d59e7071c80cbcef1561514b0","observation_id":"97e80f69-33b7-42eb-b6dc-6a7bf78de943","resolution":{"observed_at":"2026-08-05T17:34:02.788127Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-05T17:33:59.015664Z","title":"Charles, and 21 others","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.015664Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:4dc243c7f3397e245d1a31a613d8f2c641ca49bbc30cc92113ee0760f27aa8b5","observation_id":"c5553f19-6b4a-4f6c-8e28-6bcc66770cb7","resolution":{"observed_at":"2026-08-05T17:33:59.015664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11263-019-01158-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Nicolaou, Athanasios Papaioannou, Guoying Zhao, Björn Schuller, Irene Kotsia, and Stefanos Zafeiriou","venue":"International Journal of Computer Vision","work_id":"f264ea31-8522-4559-b255-be0925152081","year":2019},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.105478Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:955fb44e5224e1fa6d0d8a4ed7db8e0c5150cc08810ffbd3fe513baf8f4008a0","observation_id":"7e1b7d1e-8efa-41bc-ab18-74194098f6d6","resolution":{"observed_at":"2026-08-05T17:34:02.533049Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T17:33:59.183333Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.183333Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:64c3edb2b738b3b7e6179549aa686b10cd353f6177968ef22e609bd4199a6914","observation_id":"ffd84a08-b0cc-49a2-a138-7d58b13a8840","resolution":{"observed_at":"2026-08-05T17:33:59.183333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:59.337707Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.337707Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:cada2331474070c0cb99350cceca4b14d345aaeb1af2c07e68a33836176b80d4","observation_id":"4d09edf4-5188-44eb-922d-c41a2922ab78","resolution":{"observed_at":"2026-08-05T17:33:59.337707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:06.181096Z","title":null,"venue":null,"work_id":"640d65d4-ed9e-409c-ae9e-1d0585a0f76d","year":2018},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.483783Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:efff93181d1c560ed0c30d8f25e8ac4d42870210c8f2ba577c5c25972fbbe88a","observation_id":"663ea35a-21fb-4967-b434-f56e628483c7","resolution":{"observed_at":"2026-08-05T17:34:06.263699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04410","last_updated":"2025-02-09T08:59:19Z","snapshot_observed_at":"2026-08-16T13:20:41.485941Z","submitted_at":"2024-09-06T17:14:53Z","title":"Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04410","snapshot_observed_at":"2026-08-05T17:33:59.610675Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.610675Z"},"links":{"cited_paper":"/paper/2409.04410","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:e17fa425569433d6e4bf11ae1f27ff845b29f76dee635ccdc2b0884a569e7fab","observation_id":"4fc79cfb-f55f-461a-9148-47ecfdc03d70","resolution":{"observed_at":"2026-08-05T17:33:59.610675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.32710","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:04.451180Z","title":null,"venue":null,"work_id":"71524c11-532e-4716-b8e9-80d156a84220","year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.676356Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:6208a4a0d415e3af534879a204747bc2fafc4e72aa1b8a05983c3fc7df6809f3","observation_id":"b5d759a2-6f1a-4089-8172-5397774acf31","resolution":{"observed_at":"2026-08-05T17:34:04.520513Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07162","last_updated":"2024-06-11T11:12:51Z","snapshot_observed_at":"2026-08-16T13:44:13.132375Z","submitted_at":"2024-06-11T11:12:51Z","title":"EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07162","snapshot_observed_at":"2026-08-05T17:33:59.835425Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.835425Z"},"links":{"cited_paper":"/paper/2406.07162","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:a62734f0b1dca7c4135f34acc7ab2e47e9d29267a727ea0d91ff97e98f09e04a","observation_id":"cb258ebd-d063-4120-b459-a5dddc0c6ee4","resolution":{"observed_at":"2026-08-05T17:33:59.835425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:05.989316Z","title":null,"venue":null,"work_id":"0c2a0536-df8a-46b2-a203-fb68f56fe2eb","year":1974},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.908256Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:0e44857f29a0c3dd8dee5e87d520b46a728caaa176da8bd0d68879e419619896","observation_id":"3bdb0781-3549-47ad-99f6-0415d20c507a","resolution":{"observed_at":"2026-08-05T17:34:06.095830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-08-16T14:20:11.430991Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-05T17:33:59.985974Z","title":"Costa-jussa, Maha Elbayad, Sravya Popuri, Paul-Ambroise Duquenne, Robin Algayres, Ruslan Mavlyutov, Itai Gat, Gabriel Synnaeve, Juan Pino, Benoit Sagot, and Emmanuel Dupoux","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:59.985974Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:dd16828a9f72fb9bafb245f95e4f30312f7b0559529412f2edcb517a01580449","observation_id":"eda168d1-c2e7-434b-a1a9-5e0c7175fa91","resolution":{"observed_at":"2026-08-05T17:33:59.985974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T17:34:00.056533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.056533Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:f15e303ee1f52e4c2e90d5519fa76c4c2aceb86e270f24305eb1c4a1a338c83a","observation_id":"aa51acb1-b330-48da-b312-6b86216bf9bc","resolution":{"observed_at":"2026-08-05T17:34:00.056533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00355","last_updated":"2021-07-27T14:27:27Z","snapshot_observed_at":"2026-08-16T18:34:32.910572Z","submitted_at":"2021-04-01T09:20:33Z","title":"Speech Resynthesis from Discrete Disentangled Self-Supervised Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00355","snapshot_observed_at":"2026-08-05T17:34:00.126868Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.126868Z"},"links":{"cited_paper":"/paper/2104.00355","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:f50a85b5d52cb2209e704efa87210289526f161b347cc50f039551f314c37041","observation_id":"6f7ad7f9-b680-474e-8659-d0284b47f7ea","resolution":{"observed_at":"2026-08-05T17:34:00.126868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.32330","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:04.141908Z","title":"Gnana Praveen, Patrick Cardinal, and Eric Granger","venue":null,"work_id":"60fb6fc2-8578-44c3-98de-857e136785f5","year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.197965Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:8572ef4cf283399e19661dcd72e46f5581571471151ce9d53872e08947db951b","observation_id":"1b72384d-209a-43ae-9000-9f2ff11018fe","resolution":{"observed_at":"2026-08-05T17:34:04.284502Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-16T23:32:22.645653Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T17:34:00.308771Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.308771Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:9e5b9ea9c64bb57ceb204a31e43476b8f4c016fbaae3b2376a5f5fb69d32f497","observation_id":"caf100db-4200-489f-8325-cfe907f14d70","resolution":{"observed_at":"2026-08-05T17:34:00.308771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02640","last_updated":"2016-05-09T22:22:11Z","snapshot_observed_at":"2026-08-14T22:45:19.997074Z","submitted_at":"2015-06-08T19:52:52Z","title":"You Only Look Once: Unified, Real-Time Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02640","snapshot_observed_at":"2026-08-05T17:34:00.453514Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.453514Z"},"links":{"cited_paper":"/paper/1506.02640","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:16aab4a11712c4aa618f80e240ec31a7c123c46e22a88adf442cd780f72a8621","observation_id":"b21e640d-fa8a-4b7c-a65a-5a19db3dba99","resolution":{"observed_at":"2026-08-05T17:34:00.453514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:05.739148Z","title":"Filntisis, Radek Danecek, Victoria F","venue":null,"work_id":"fd5bb1b1-092f-49ad-9e7d-6f1fa23b00c2","year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.543333Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:4b529dac6fbfa0c0365d94a15cb97298414f9b9fad329a39ccd9ba70d8c41d7a","observation_id":"9e32739f-246c-40f6-a297-46a552020ec6","resolution":{"observed_at":"2026-08-05T17:34:05.843914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:05.608536Z","title":null,"venue":null,"work_id":"72d19639-5c75-4c39-b7ca-dde875d003aa","year":2013},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.618482Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:2c43cc8a25b793e83e5db992d46ae1e81fa03c192ce3001e196de2a6969bd802","observation_id":"5c9913c5-d99d-4286-9b2d-6fb3bf05cf72","resolution":{"observed_at":"2026-08-05T17:34:05.679001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.10043","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:03.877652Z","title":"Savchenko","venue":null,"work_id":"3cb82d08-bb32-46e0-8d5d-97fc1a697ce0","year":2022},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.690614Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:a7227af980f96883c10deed8bff8983eb766cc20602057da194abe2fa71b3ea6","observation_id":"110c9b3f-1c72-491a-a7ff-363128b915ad","resolution":{"observed_at":"2026-08-05T17:34:03.938367Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-16T17:30:04.943064Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-05T17:34:00.745331Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.745331Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:8d223e2d83e8c7d01a20e5fc79f1715d14feccc03f23d2049734310d6e0a3f4c","observation_id":"808bfc5e-bf43-4fc8-9399-8e9f2e1dc2de","resolution":{"observed_at":"2026-08-05T17:34:00.745331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00168","last_updated":"2025-05-17T15:25:50Z","snapshot_observed_at":"2026-08-16T13:13:58.487022Z","submitted_at":"2024-09-30T19:17:46Z","title":"SSR: Alignment-Aware Modality Connector for Speech Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00168","snapshot_observed_at":"2026-08-05T17:34:00.859965Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.859965Z"},"links":{"cited_paper":"/paper/2410.00168","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:801e54d4d37680d14e2e3d288d21aacc6548b29abb429fc8bd82c009e58d4802","observation_id":"0c3cf4c4-5941-4935-b7f2-d7a544aa5371","resolution":{"observed_at":"2026-08-05T17:34:00.859965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-05T17:34:00.986813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:00.986813Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:f71fff734c349b4f52dcc13e4be7839a5712e1a9b1c6ebad3a121379ad67c4c8","observation_id":"c4860a1a-7ece-4929-872b-b83f8f6dfb78","resolution":{"observed_at":"2026-08-05T17:34:00.986813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08166","last_updated":"2024-01-16T07:13:16Z","snapshot_observed_at":"2026-08-16T14:27:13.579900Z","submitted_at":"2024-01-16T07:13:16Z","title":"ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2401.08166","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.08166","snapshot_observed_at":"2026-08-05T17:34:03.528650Z","title":"ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis","venue":"eess.AS","work_id":"49307d2c-7d5a-4010-bd72-699877e08918","year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:01.108489Z"},"links":{"cited_paper":"/paper/2401.08166","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:7f64e3b0de1857dde94ad4a808fd82165f308a29935514eea69337093ccc2f5c","observation_id":"e6e0c795-db41-4b7d-b1a3-b682878165fa","resolution":{"observed_at":"2026-08-05T17:34:03.655927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:01.213055Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:01.213055Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:617a76a1c474040fd35bfbed580836bd31462d69ca40f33f24daf2fe2fcbca37","observation_id":"7c0cd412-a729-4de7-97f9-6016df520be0","resolution":{"observed_at":"2026-08-05T17:34:01.213055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05709","last_updated":"2023-06-09T07:04:56Z","snapshot_observed_at":"2026-08-16T15:25:15.826025Z","submitted_at":"2023-06-09T07:04:56Z","title":"Learning Emotional Representations from Imbalanced Speech Data for Speech Emotion Recognition and Emotional Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2306.05709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.05709","snapshot_observed_at":"2026-08-05T17:34:03.321451Z","title":"Learning Emotional Representations from Imbalanced Speech Data for Speech Emotion Recognition and Emotional Text-to-Speech","venue":"eess.AS","work_id":"0f7af283-9e35-42aa-9b86-b932e9fbf7a0","year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:01.368593Z"},"links":{"cited_paper":"/paper/2306.05709","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:3c25daf1815a5bda34b9b0b6bbd5bafe805b1a111e57164a097e3645c6c3d70f","observation_id":"dfd0e853-501a-417b-9ef9-669af933ccb3","resolution":{"observed_at":"2026-08-05T17:34:03.399162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03917","last_updated":"2023-10-02T06:57:19Z","snapshot_observed_at":"2026-08-16T15:17:48.344224Z","submitted_at":"2023-07-08T06:47:58Z","title":"On decoder-only architecture for speech-to-text and large language model integration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03917","snapshot_observed_at":"2026-08-05T17:34:01.439343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:01.439343Z"},"links":{"cited_paper":"/paper/2307.03917","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:ee94695158322d4ca3a70641261b924d0c498609a9615845d99715c35549c3ca","observation_id":"e6774275-4465-4540-938b-a465f1af10e6","resolution":{"observed_at":"2026-08-05T17:34:01.439343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06273","last_updated":"2025-07-21T06:53:55Z","snapshot_observed_at":"2026-08-16T12:51:55.343464Z","submitted_at":"2025-03-08T16:40:13Z","title":"Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations","version":2},"cited_work":{"arxiv_id":"2503.06273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06273","snapshot_observed_at":"2026-08-05T17:34:03.114904Z","title":"Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations","venue":"cs.CV","work_id":"e05fa1e4-712e-4cc3-8db0-8fca9f247f32","year":2025},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:01.561018Z"},"links":{"cited_paper":"/paper/2503.06273","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:ec9b130f4da646805c40ef0c32dce52ea3246035839e8286f2690f488dfe015f","observation_id":"8ff5aa8c-7edf-46c0-b050-e3613060da67","resolution":{"observed_at":"2026-08-05T17:34:03.190941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11315","last_updated":"2025-06-05T05:58:37Z","snapshot_observed_at":"2026-08-16T12:50:02.793500Z","submitted_at":"2025-03-14T11:31:30Z","title":"MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens","version":2},"cited_work":{"arxiv_id":"2503.11315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.11315","snapshot_observed_at":"2026-08-05T17:34:02.993507Z","title":"MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens","venue":"cs.CV","work_id":"faa6ff6b-e1c9-4004-a66b-f3812a77768c","year":2025},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:01.706260Z"},"links":{"cited_paper":"/paper/2503.11315","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:cbb72eb8aab127d3e339112965dacd51c9848fce133d92d3cdcc3286bdfbd312","observation_id":"9f5fa781-25c0-46e3-9844-bdff186365df","resolution":{"observed_at":"2026-08-05T17:34:03.090588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T17:34:01.775720Z","title":"Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:01.775720Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:7307857064e58774589c6d4f918a034d128ab640b8a30c61d0958c5cbb59a58c","observation_id":"aaea03a9-88b0-4faa-9aa9-509c2580afd1","resolution":{"observed_at":"2026-08-05T17:34:01.775720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13963","last_updated":"2023-09-26T11:09:25Z","snapshot_observed_at":"2026-08-16T14:57:56.145317Z","submitted_at":"2023-09-25T08:57:07Z","title":"Connecting Speech Encoder and Large Language Model for ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13963","snapshot_observed_at":"2026-08-05T17:34:01.896810Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:01.896810Z"},"links":{"cited_paper":"/paper/2309.13963","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:d56b6b898a81a54c16476262ada06a2db6394a3b1b29ff786dff58ca812fd571","observation_id":"0838ca54-6fcb-4d9b-85f9-69feb110e7ab","resolution":{"observed_at":"2026-08-05T17:34:01.896810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-16T15:31:59.521123Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-05T17:34:02.039158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:02.039158Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:431d16bbf3a7c723b7cca31e3819d607e5ceffeabb012cbbdd5ed3d8033abb30","observation_id":"abe02ded-932b-4f26-995d-3162e8dc2afa","resolution":{"observed_at":"2026-08-05T17:34:02.039158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:02.123009Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:02.123009Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:e25911cd3bc465e14f24dc15c429c90deca5cf2d12ae0b2c1286db9af9720b21","observation_id":"31ccc46f-1fbb-4f3a-a6fc-d4040db498ac","resolution":{"observed_at":"2026-08-05T17:34:02.123009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:34:02.234077Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T17:34:02.234077Z"},"links":{"citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:ae537476cfb7e17aa0ecc860b468c70afa2cab094d5fbcead823acc3828d280a","observation_id":"712385bd-aedf-40f4-a670-0a09eabc81b9","resolution":{"observed_at":"2026-08-05T17:34:02.234077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:50:39.724461Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":40,"verified_exact":7,"verified_fuzzy":2},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2508.16188."}