{"as_of":"2026-08-18T05:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:27c0c98793d516d43533fd76600fc99dadb99211a3b06ea5ced08fdb46360a9e","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:17:33.475816Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:17:33.349929Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T20:17:33.661042Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"cited_work":{"arxiv_id":"2505.13338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13338","snapshot_observed_at":"2026-08-15T20:17:33.661042Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","venue":"cs.CL","work_id":"5bdfd176-a700-4226-a456-eac824b9e7ae","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.349929Z"},"links":{"cited_paper":"/paper/2505.13338","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:a86034542d4288a518b588e03e3176ee6f8c8e0ab671f9631c796efb1552331a","observation_id":"5b3e0b13-e110-4c94-b1d6-097889e13798","resolution":{"observed_at":"2026-08-15T20:17:33.666296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13338/citation-record","integrity":"/paper/2505.13338/integrity","json":"/paper/2505.13338/citation-record.json","paper":"/paper/2505.13338"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.928233Z","title":"Recent speech-LLMs, such as GPT-4 [1], Qwen-audio [2, 3], SALMONN [4], and MERaLiON-AudioLLM [5, 6], have demonstrated remarkable performance in handling speech-based tasks","venue":null,"work_id":"8c79b158-c41f-41f8-8418-512c7031385e","year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.345621Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:309328579bfff4c7e8129ff77033893d70f380c4007cc337fb586d16940d2945","observation_id":"df2a375e-9c0e-41e4-8847-09a411b397de","resolution":{"observed_at":"2026-08-15T20:17:33.932117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"cited_work":{"arxiv_id":"2505.13338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13338","snapshot_observed_at":"2026-08-15T20:17:33.661042Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","venue":"cs.CL","work_id":"5bdfd176-a700-4226-a456-eac824b9e7ae","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.349929Z"},"links":{"cited_paper":"/paper/2505.13338","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:a86034542d4288a518b588e03e3176ee6f8c8e0ab671f9631c796efb1552331a","observation_id":"5b3e0b13-e110-4c94-b1d6-097889e13798","resolution":{"observed_at":"2026-08-15T20:17:33.666296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.918212Z","title":"What is the content in the audio from the text transcript?","venue":null,"work_id":"225dc37e-6aaa-4e22-833f-562286956677","year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.353733Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:84e7a96edc67e6725e5ce36a7e916b0f32081fe86832204cfa2a295d676d1e92","observation_id":"44a15b1d-4201-4976-9b78-db81f5b07cdf","resolution":{"observed_at":"2026-08-15T20:17:33.921636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.907432Z","title":null,"venue":null,"work_id":"d6135721-de12-4455-8081-bdc0ec9c4f6d","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.357222Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:f2d6bde31aba9bc003e3693245137bd3ea9a36fc87f64872d4fdc9ff26f91d19","observation_id":"7c3ff951-5a41-4ef3-b9a1-8ddfa4e8a78d","resolution":{"observed_at":"2026-08-15T20:17:33.911818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.896829Z","title":null,"venue":null,"work_id":"f9871ef0-d61b-4448-a8f1-e91800775d4b","year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.360522Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:834999352cba172a3abb0004c92162cd583eae7ef8baeeb15fb9643eb27b6a25","observation_id":"d1a5bcd2-cc09-493b-a09b-067d749df2e0","resolution":{"observed_at":"2026-08-15T20:17:33.900926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.364103Z","title":"Our framework con- sists of pseudo paralinguistic label-based data condensation and LLM-based CPQA generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.364103Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:7afee3ee871e565986bccd3563e93e5fd64d485d1b3d800fbaee6dda6a2274db","observation_id":"c8563fb2-e5da-44cf-bd61-a3d7a911e0e5","resolution":{"observed_at":"2026-08-15T20:17:33.364103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.886605Z","title":null,"venue":null,"work_id":"26bfc673-71e7-4924-bfaf-636a154f8e5d","year":null},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.367822Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:401af2aa3d15cb52914cdb71be9b038a3cfeff855d0afdcff054df1c36b26590","observation_id":"257f1e2b-b648-44d7-81eb-7239a32a713c","resolution":{"observed_at":"2026-08-15T20:17:33.890556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:17:33.371023Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.371023Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:f9e50a2ec32dbbf7a5bba60c1c6a337918f9e0b9de2f184a852ed1564b22793d","observation_id":"a8c59dad-2984-4c64-b67b-03064de6c960","resolution":{"observed_at":"2026-08-15T20:17:33.371023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-15T20:17:33.374448Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.374448Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:93435007d25cc05a68e855098c5adfcde783afa3684e41e3e03a1effed0544b3","observation_id":"d4e56222-2487-41b0-b0f7-c939eed97885","resolution":{"observed_at":"2026-08-15T20:17:33.374448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T20:17:33.377815Z","title":"Qwen2-audio technical re- port,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.377815Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:ed73d807332430d2e05a9a93348bdafba336f0efced05f9f98b19d09d657631e","observation_id":"8ec7c9d2-eead-4631-8149-034f16ba74cb","resolution":{"observed_at":"2026-08-15T20:17:33.377815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-15T20:17:33.380885Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.380885Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:ff2f719ee02b0c787b189d146f6221e95819f94976799203965c5db6d5555018","observation_id":"c02a3a55-2109-418b-a084-029faeb96724","resolution":{"observed_at":"2026-08-15T20:17:33.380885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09818","last_updated":"2025-01-16T03:29:23Z","snapshot_observed_at":"2026-08-15T13:23:21.388081Z","submitted_at":"2024-12-13T03:15:05Z","title":"MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09818","snapshot_observed_at":"2026-08-15T20:17:33.384225Z","title":"MERaLiON-AudioLLM: Technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.384225Z"},"links":{"cited_paper":"/paper/2412.09818","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:b51a2ababb75acd60353e62caeceeb5b30342aba94746ca81f32502a1a17e0dd","observation_id":"b47227b3-c8cf-413e-916b-6b0f82b780df","resolution":{"observed_at":"2026-08-15T20:17:33.384225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11538","last_updated":"2025-09-11T05:26:13Z","snapshot_observed_at":"2026-08-16T07:55:28.523537Z","submitted_at":"2024-12-16T08:15:19Z","title":"MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11538","snapshot_observed_at":"2026-08-15T20:17:33.387816Z","title":"Towards a speech foundation model for singapore and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.387816Z"},"links":{"cited_paper":"/paper/2412.11538","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:021502437e0ae2b41ea0a7aa4f6d736438b59ef7a953a538c8f51fbbfbb227ea","observation_id":"79ba7230-e884-473a-bbec-18385fee75db","resolution":{"observed_at":"2026-08-15T20:17:33.387816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03872","last_updated":"2024-06-06T09:02:31Z","snapshot_observed_at":"2026-08-17T21:15:44.958706Z","submitted_at":"2024-06-06T09:02:31Z","title":"BLSP-Emo: Towards Empathetic Large Speech-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03872","snapshot_observed_at":"2026-08-15T20:17:33.391551Z","title":"BLSP-Emo: Towards empathetic large speech-language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.391551Z"},"links":{"cited_paper":"/paper/2406.03872","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:6952ef5e3c040574177597abdc940d5537c796157a7e96f88b62bb55b72acac6","observation_id":"c1a5cc0e-951c-4a5a-92d5-eb332a8eccf7","resolution":{"observed_at":"2026-08-15T20:17:33.391551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-15T20:17:33.394954Z","title":"AudioPaLM: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.394954Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:ec5df75021180b5254cfed8e7e9c7e3e95feb6db80be790ec34bdac0582df9e1","observation_id":"bcac46d7-5359-459f-a598-dae8ec7ca2c0","resolution":{"observed_at":"2026-08-15T20:17:33.394954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-16T14:54:18.806254Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-15T20:17:33.399189Z","title":"LauraGPT: Listen, attend, understand, and regenerate audio with GPT,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.399189Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:76efd5599415daeefa3eb7359272bb01607fa74e9ec5cf8f881eccb28919c761","observation_id":"f5e1c955-edc6-462f-bfaf-0e48780e59b4","resolution":{"observed_at":"2026-08-15T20:17:33.399189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.876788Z","title":"Advancing large lan- guage models to capture varied speaking styles and respond prop- erly in spoken conversations,","venue":null,"work_id":"4aa6c6eb-4c1c-4b32-8998-527940bdb096","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.402172Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:d92db62cd805c752de70aeda16b00dd09be22f2914444cf05299bd4aa9b0c50d","observation_id":"7cd1ed08-992a-426b-a7d7-721c2ccef8fc","resolution":{"observed_at":"2026-08-15T20:17:33.880417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00916","last_updated":"2024-05-28T14:26:28Z","snapshot_observed_at":"2026-08-16T15:03:49.368681Z","submitted_at":"2023-09-02T11:46:05Z","title":"BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00916","snapshot_observed_at":"2026-08-15T20:17:33.405082Z","title":"BLSP: Bootstrapping language-speech pre-training via behavior alignment of continuation writing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.405082Z"},"links":{"cited_paper":"/paper/2309.00916","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:271371db60e7e6c14f6c2f9ab8fb9767f3e51b383fc77a226f0d426a8fa74427","observation_id":"adf22b68-6130-4741-bcf3-9340321f1889","resolution":{"observed_at":"2026-08-15T20:17:33.405082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.864651Z","title":"Paralinguistics-aware speech- empowered large language models for natural conversation,","venue":null,"work_id":"b59565e1-837b-4707-939a-15f7e328c8b7","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.409218Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:58e894df7c2a7f4534523c07a963f2c21739b8654a847ddfb024c6a4a6f94213","observation_id":"bb7090e5-9f39-421b-b88a-f8e163372e9a","resolution":{"observed_at":"2026-08-15T20:17:33.868245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01162","last_updated":"2025-05-19T22:01:39Z","snapshot_observed_at":"2026-08-16T13:13:32.629020Z","submitted_at":"2024-10-02T01:32:47Z","title":"Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01162","snapshot_observed_at":"2026-08-15T20:17:33.412848Z","title":"Frozen large language mod- els can perceive paralinguistic aspects of speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.412848Z"},"links":{"cited_paper":"/paper/2410.01162","citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:fa30d143ad0669af8b715c12d9bc8c7d608eaacecf52fcb0fb4c03cb6da26dcf","observation_id":"6a3ad9af-4b75-44f7-8891-2fe02c825a7a","resolution":{"observed_at":"2026-08-15T20:17:33.412848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.854311Z","title":"AudioBench: A universal benchmark for audio large language models,","venue":null,"work_id":"3fcfc64b-d12c-4ae0-8099-2e6f3e88812d","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.415869Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:4d1cb9cc7ff5f38f88e06686a8192b72100bd248c747ffdef454a78ede470552","observation_id":"5cad0500-702b-4260-805d-dfb6d0be4ad9","resolution":{"observed_at":"2026-08-15T20:17:33.858006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.843757Z","title":"Dynamic-superb: To- wards a dynamic, collaborative, and comprehensive instruction- tuning benchmark for speech,","venue":null,"work_id":"d5aaf18d-ae57-4bf5-9d7b-4427b3c38459","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.418994Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:581b184f728b799df03e423308363de92d4b43bb7c6b02143a6578ad1a14a09a","observation_id":"40ca13f3-6ee6-43b9-96a4-2eb4d6e4422c","resolution":{"observed_at":"2026-08-15T20:17:33.847956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.833413Z","title":"AIR-bench: Benchmark- ing large audio-language models via generative comprehension,","venue":null,"work_id":"5a1b088b-356e-45f9-97fa-3ba1c9f6e3f5","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.422609Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:b5fe5de6ff9ad36e31ad6488436128fc69f0e1daef84db24775046eb45e7952c","observation_id":"d7cda837-7c18-4c6c-822a-2c129c3e9a70","resolution":{"observed_at":"2026-08-15T20:17:33.837167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.425641Z","title":"Listen, think, and understand,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.425641Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:52d6cc9b10466f7382339fcb2a096c820486692231c4eaa7ac160419478da3fa","observation_id":"b88e64c0-7555-4a25-9946-fbe3044dbbf5","resolution":{"observed_at":"2026-08-15T20:17:33.425641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.814154Z","title":"MMAU: A mas- sive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":"a17cff71-ecdb-4b5b-985a-112e1f1144b0","year":2025},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.428590Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:82845ecd9fd65df6b13bbbaeece00d1920461b1f5efd7a241860f8fe303fbbaa","observation_id":"3c5cccfd-59b3-42fd-aa6f-9f515ba723aa","resolution":{"observed_at":"2026-08-15T20:17:33.818914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.803810Z","title":"IEMOCAP: interactive emotional dyadic motion capture database,","venue":null,"work_id":"21beccec-f123-4b1c-9dfe-97c42cda4707","year":2008},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.431691Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:75f116571145bbbcaa392667b022f65ec0557fa623f410bf6f1d8fba264f070c","observation_id":"8965e6db-6080-48ac-804c-ad5240d7ae40","resolution":{"observed_at":"2026-08-15T20:17:33.807231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.793591Z","title":"MELD: A multimodal multi-party dataset for emo- tion recognition in conversations,","venue":null,"work_id":"b7b24e5f-243a-4989-9fe8-8a6d6d53711c","year":2019},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.434765Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:14e0d03031ce025caee25962f8f5d4599c0688e99031c1e9bd4a57a6d2ed07f2","observation_id":"d012c2ef-7d75-4efe-8248-b05d1ac94826","resolution":{"observed_at":"2026-08-15T20:17:33.797163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.782164Z","title":"What’s basic about basic emotions?","venue":null,"work_id":"aa0ab1ca-41d7-4c5b-83cd-ebeea2cc5b74","year":1990},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.438307Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:e2d4c6273da9338c95ad1f82d143a8037aad58000ccd9432bd75c61c3ef04532","observation_id":"a129374a-a85b-4739-941c-7dd619b5a975","resolution":{"observed_at":"2026-08-15T20:17:33.785652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.772474Z","title":"Theories of emotion,","venue":null,"work_id":"863308b1-70ed-493c-a18f-ab3ab0335aa2","year":2013},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.441242Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:22c72823bd128bfcaf52bfb090cd89cb25253ef59e17858412b18f3438f14602","observation_id":"85b7fc7a-0eb6-4d69-b73d-087401a787b0","resolution":{"observed_at":"2026-08-15T20:17:33.775706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.761877Z","title":"EmoBox: Multilingual multi-corpus speech emotion recognition toolkit and benchmark,","venue":null,"work_id":"cdaab0cc-6361-4c87-8dea-252744e7bb69","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.444355Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:b8af45c2457326c46acc2d685a19a545b68c9cde81cf56cdc49405e71f9602de","observation_id":"2418c4d2-380d-4b51-8d7d-6902ebc7b32e","resolution":{"observed_at":"2026-08-15T20:17:33.765848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.751728Z","title":"Evidence for a three-factor the- ory of emotions,","venue":null,"work_id":"1dac6d2c-09c7-48c2-90be-069b324f7631","year":1977},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.447515Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:8209074e83efb0121a6295bc64d49a0aae373fe73a5f5a4aec2597ed78e83c77","observation_id":"8bc8255e-2381-4b4b-b1f3-04acb1b2d49b","resolution":{"observed_at":"2026-08-15T20:17:33.755021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.741662Z","title":"Goemotions: A dataset of fine-grained emo- tions,","venue":null,"work_id":"3e815c2e-ff1a-4fbc-8fb0-e3ff5a3ed8bd","year":2020},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.450756Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:b06b8dc923310a35927b655aa9c30fdb2f20b0e696ac9dc498ed506757feedbc","observation_id":"5fc62db6-16d6-42cf-accd-f389cbbbabf2","resolution":{"observed_at":"2026-08-15T20:17:33.745284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.731020Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":"a05a82b8-ebfa-4d88-bdf1-3b5b1f5b2857","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.454003Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:ba2bfc96d5a6c9140219a1ed99447659b8b06a6f2bd3fd2a9ef08df02c6658f6","observation_id":"90ead142-5439-4f7a-bcd5-0cfd198265af","resolution":{"observed_at":"2026-08-15T20:17:33.734700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.457390Z","title":"Dawn of the trans- former era in speech emotion recognition: Closing the valence gap,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.457390Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:b72158eff75207ac3c8ad54b453c1786a0d60cb11c792df99481f019e70d3ef8","observation_id":"5d0fc0a3-4a9a-4c29-836a-9cf4ef2e8d60","resolution":{"observed_at":"2026-08-15T20:17:33.457390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.714290Z","title":"Building naturalistic emotionally bal- anced speech corpus by retrievingemotional speech from existing podcast recordings,","venue":null,"work_id":"54f59ad7-332e-4a7e-85b3-0d12f4822716","year":2019},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.460553Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:3adf09a9c6e0204ba980fecd2cd31766616be46d173ab1d057ab6ab14b9eff56","observation_id":"481c58b7-2554-485f-b02e-aeb833128bff","resolution":{"observed_at":"2026-08-15T20:17:33.718410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.463514Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.463514Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:43786c44f6bb149b0799c9a151f70262c75734611597966a600c6283d7fffeed","observation_id":"3cbdafd9-b7a6-4a4b-ac0c-3a9ef94c2ea6","resolution":{"observed_at":"2026-08-15T20:17:33.463514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.698670Z","title":"Ecapa-tdnn: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":"7dd1059a-021a-447e-ac9d-aa3cb15edd5b","year":2020},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.466518Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:32c26ba1bde1e82774952422ecf4ee8c489b6d9f2087c9100d6f3a3d4a4e7e21","observation_id":"26111fcc-14e8-4c9d-8386-3f5270689267","resolution":{"observed_at":"2026-08-15T20:17:33.701994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.469808Z","title":"V oxCeleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.469808Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:b04d441ff5fc1aed0dc6cd07300be9f2b7d34bc15114768f2893fab6b4b55c0d","observation_id":"35d844f6-a36d-41b0-a4a0-63ae8a49271c","resolution":{"observed_at":"2026-08-15T20:17:33.469808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.683420Z","title":"WhisperX: Time- accurate speech transcription of long-form audio,","venue":null,"work_id":"95901536-ac66-4e62-ac26-58a384e0ad12","year":2023},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.472777Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:f9994dbc20b211bf9ff10399278ac492c9732b7cb6614ab843e3c26eb18a1349","observation_id":"3a6e8142-01c7-4b17-8889-90906e41acac","resolution":{"observed_at":"2026-08-15T20:17:33.686760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:17:33.673458Z","title":"The Llama 3 herd of models,","venue":null,"work_id":"a0febdc1-30e1-4fd7-87a1-df9e0bfb2d12","year":2024},"citing_paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:17:33.475816Z"},"links":{"citing_paper":"/paper/2505.13338"},"observation_digest":"sha256:2021b56057c9c79aa5377b8ac3838a4a49eab0e7d6f1ddfabaca707e465c2d6a","observation_id":"e96a01a8-e897-4f96-8521-8b45b64ba23a","resolution":{"observed_at":"2026-08-15T20:17:33.676651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13338","last_updated":"2025-06-03T04:11:48Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T21:15:08.318382Z","submitted_at":"2025-05-19T16:47:46Z","title":"Contextual Paralinguistic Data Creation for Multi-Modal Speech-LLM: Data Condensation and Spoken QA Generation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2505.13338."}