{"as_of":"2026-08-14T16:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:097243a86dfa6a4b9e51567b387b1415543ef968d7eaf7cdb1885816e22a8eef","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:19:03.131803Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.07273/citation-record","integrity":"/paper/2508.07273/integrity","json":"/paper/2508.07273/citation-record.json","paper":"/paper/2508.07273"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T22:18:57.881185Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:57.881185Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:63ae35bf83233779e74616c747f055043a73b0aec39f65411bc8317c054de60b","observation_id":"c4826f91-e930-4571-af64-868e66878355","resolution":{"observed_at":"2026-08-05T22:18:57.881185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T22:18:57.990172Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:57.990172Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:2bc90e72655a082f17aeccc5e4c833487a66253e09f1087f1f88e9e2f238bcb7","observation_id":"1cb81b11-8db1-4cfb-8362-02103d244f99","resolution":{"observed_at":"2026-08-05T22:18:57.990172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T22:18:58.130239Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:58.130239Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:511f99ff198fdb79893c12da7ba92e0d6e72321129e29d6500e8eee079c0a7de","observation_id":"7fcdb65a-1231-4ffe-8460-ed12d2a6d3e6","resolution":{"observed_at":"2026-08-05T22:18:58.130239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-05T22:18:58.276120Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:58.276120Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:263bc27a8c219e620f5de42d6c8052d637d98bb4409662fb8ce91fed34d60d13","observation_id":"1436705d-17b9-439d-b5a3-4e5eb7a9d8b1","resolution":{"observed_at":"2026-08-05T22:18:58.276120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12786","last_updated":"2024-05-30T09:06:34Z","snapshot_observed_at":"2026-08-13T04:14:45.027101Z","submitted_at":"2024-02-20T07:51:43Z","title":"Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12786","snapshot_observed_at":"2026-08-05T22:18:58.424699Z","title":"Advancing large language models to capture varied speaking styles and respond properly in spoken conversations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:58.424699Z"},"links":{"cited_paper":"/paper/2402.12786","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:4fab9f6a208890faf580bdcdb3b41b274bb291b3b859cdc4cd6d699931a5e257","observation_id":"c9d18b3b-045c-439f-89c4-e4529e4a8c42","resolution":{"observed_at":"2026-08-05T22:18:58.424699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:11.074750Z","title":"Paralinguistics- aware speech-empowered large language models for natural conversa- tion,","venue":null,"work_id":"673476b8-203f-4d83-83a5-86be25841c44","year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:58.577376Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:8370b680d4d0fc7d08680e0c48d0679ac07746d8a24f6f15090dd2f11766eef1","observation_id":"e3f07d77-2dea-496e-8e8e-f7d5bfd38919","resolution":{"observed_at":"2026-08-05T22:19:11.147456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01162","last_updated":"2025-05-19T22:01:39Z","snapshot_observed_at":"2026-08-13T18:00:05.590039Z","submitted_at":"2024-10-02T01:32:47Z","title":"Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01162","snapshot_observed_at":"2026-08-05T22:18:58.748810Z","title":"Frozen large language models can perceive paralinguistic aspects of speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:58.748810Z"},"links":{"cited_paper":"/paper/2410.01162","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:40375ef6c495bf2765f4bd3835bf3342e097a7279d9f4a7f352321cabd052d11","observation_id":"e89fc06b-8bf9-41ef-91c5-30cafc19f03d","resolution":{"observed_at":"2026-08-05T22:18:58.748810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:10.880485Z","title":"BLSP-Emo: Towards empathetic large speech-language models,","venue":null,"work_id":"9c9408fd-35bd-4495-8fa5-9cbfe576b55f","year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:58.914092Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:f9c79227ddbe881fd27f958a02c63e7585b845fbb69c5c0137a39cdeb1e248d9","observation_id":"f74ae3df-7fb6-47ad-a15e-ca1f4bd8c37e","resolution":{"observed_at":"2026-08-05T22:19:10.990667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:10.704912Z","title":"DeSTA: Enhancing speech language models through descriptive speech-text alignment,","venue":null,"work_id":"7190c5ac-5ca5-47e1-b1b7-2d10a70d0f51","year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:59.038997Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:764fe18371031e4fc7dd9b449685873d06123516c01f2119230ec88c81da6309","observation_id":"ff0d1a75-3f6f-4567-879c-7ec9dd830f1c","resolution":{"observed_at":"2026-08-05T22:19:10.821861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:10.400152Z","title":"DeSTA2: Developing instruction-following speech language model without speech instruction-tuning data,","venue":null,"work_id":"597ea64f-3e6f-4976-a63e-015e537a0d9f","year":2025},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:59.198133Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:27b7ce756bf24ecc2934a370e77fea80ae32274a57ab13572d92b4e9c0bd3d9b","observation_id":"f7cde303-a5b5-4319-838c-36ce2085b52c","resolution":{"observed_at":"2026-08-05T22:19:10.568200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:10.118987Z","title":"Beyond silent letters: Amplifying LLMs in emotion recognition with vocal nuances,","venue":null,"work_id":"256df793-fa62-4113-8deb-30e6320e405f","year":2025},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:59.330714Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:3796c7a34ab0897a1e1e06a76ea854e28c191093d3d12c2f817472fe24b883e2","observation_id":"396c684e-e5fa-4f94-9cb2-6c0ca3d20be2","resolution":{"observed_at":"2026-08-05T22:19:10.233939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:09.844068Z","title":"CLAP4Emo: ChatGPT-Assisted Speech Emotion Retrieval with Natural Language Supervision,","venue":null,"work_id":"b7611725-6014-495d-9496-f061ed4a9f29","year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:59.466028Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:4d4a8940b24ed827fe537348dfee6475d2b5644581679fee2b6610efae07fb0d","observation_id":"13f75bb6-1233-458d-9f6c-93ae9b31edc1","resolution":{"observed_at":"2026-08-05T22:19:09.973950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:09.556486Z","title":"SECap: Speech emotion captioning with large language model,","venue":null,"work_id":"8e9af5d3-5eda-48eb-b9b8-200d7ba40560","year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:59.633364Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:84af56ad678922799a94283fd83f29f33c9ffb511e9ea999d994c7565c2bcc23","observation_id":"7080ceca-6ea4-400f-9df0-0ebcb419c949","resolution":{"observed_at":"2026-08-05T22:19:09.690497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:09.213130Z","title":"Empower typed descriptions by large language models for speech emotion recognition,","venue":null,"work_id":"62df52a2-eb2d-4194-a8ae-aa5b75efafc0","year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:59.813350Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:20de91c5e23efd8bdf09bed28a8b84e50f0afbcce77917adcf1618b484e26965","observation_id":"d5f71264-0a61-41af-9a2f-98dad20db104","resolution":{"observed_at":"2026-08-05T22:19:09.371189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:08.921481Z","title":"V oxDialogue: Can spoken dialogue systems understand information be- yond words?,","venue":null,"work_id":"6207dc02-64f3-4c74-b921-c59686d6f6a4","year":2025},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:18:59.969824Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:d2feff9793f127efe8ae88db6547a9f4c427dfcee66cc758fab3e5003785f538","observation_id":"10f686a7-c02d-4952-944b-47344877811a","resolution":{"observed_at":"2026-08-05T22:19:09.084928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09081","last_updated":"2025-04-17T17:34:21Z","snapshot_observed_at":"2026-08-12T14:32:56.066828Z","submitted_at":"2025-04-12T04:45:48Z","title":"SIFT-50M: A Large-Scale Multilingual Dataset for Speech Instruction Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09081","snapshot_observed_at":"2026-08-05T22:19:00.083040Z","title":"SIFT-50M: A large-scale multilingual dataset for speech instruction fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:00.083040Z"},"links":{"cited_paper":"/paper/2504.09081","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:03b8fd22a7e1db713587d65ebc487ba56ab5ec9a7091ed172911291419fb6e20","observation_id":"1b006634-4d6e-4d48-9493-50b63c761dd7","resolution":{"observed_at":"2026-08-05T22:19:00.083040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:08.539837Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"94c30f30-095e-4c0b-832c-444aa159761e","year":2023},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:00.249738Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:d5930828c05dde64e91615649aaeda4f08202ff3a3e5a2cb88a944538e7226cf","observation_id":"cdf56ab7-5479-448e-8915-d9f2f0a21bb0","resolution":{"observed_at":"2026-08-05T22:19:08.715779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:08.210074Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":"534d8935-c560-42a5-b2ec-32a2ac53f0d7","year":2025},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:00.426892Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:283b7f7759f01063164a693551b4f322b9e2541c68d179357a0039ecdd03a9d0","observation_id":"51b62e32-e945-4c14-b2b6-cb1845bf5548","resolution":{"observed_at":"2026-08-05T22:19:08.375935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:07.943803Z","title":"Dynamic-superb: Towards a dy- namic, collaborative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":"6da525b1-fd51-4504-808e-dd72507653ab","year":null},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:00.562787Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:446f91a28794a2277921c3b8c09bf77b87e9178ee2746229777a031deb0fa1f7","observation_id":"284eb8ae-8932-40b7-91df-fa2f241005f9","resolution":{"observed_at":"2026-08-05T22:19:08.072863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:07.667464Z","title":"AIR-Bench: Benchmarking large audio-language models via generative comprehension,","venue":null,"work_id":"b667b177-fb01-45fe-ae04-bd142f3c68ff","year":1979},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:00.758702Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:cb0bd613203f1c3b65ef90d4a4e339153c65ab4c597916cbf4077bff8821d362","observation_id":"d038238a-12da-4994-a9e6-9e592a756ec2","resolution":{"observed_at":"2026-08-05T22:19:07.775254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:07.313672Z","title":"Listen, think, and understand,","venue":null,"work_id":"8657bd62-aa41-46c0-8df4-ad7e76e6dbbd","year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:00.929096Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:e393ccdf98750e640aa3a6b4df938e8b8258b32410c532d925671bf2663409cd","observation_id":"f66111f0-5d6c-4ac9-ba14-ec29dfebf371","resolution":{"observed_at":"2026-08-05T22:19:07.482732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:06.990524Z","title":"MMAU: A massive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":"59909202-c381-48fb-b510-4055a0d8c001","year":2025},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:01.094132Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:947ac237461206679520b9ef16237dff64271f044d36dd24c762d4123f266897","observation_id":"9f16ec29-7210-4b16-b1a6-a47cc5d313d9","resolution":{"observed_at":"2026-08-05T22:19:07.156600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:06.656673Z","title":"Contextual paralinguistic data creation for multi-modal Speech-LLM: Data condensation and spoken QA generation,","venue":null,"work_id":"5e400b26-66d5-472a-a8f7-b215e5b8f4bf","year":2025},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:01.230959Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:88fb3248dad8bbd2f2ee5b7212b4e0a75deb72d298ee4404ddc469d193ae77d7","observation_id":"33fb1d05-d676-4deb-aa92-c26ab73481ce","resolution":{"observed_at":"2026-08-05T22:19:06.815227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:06.417690Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"d85a2186-ddae-49f7-a0c0-7aa422c39c26","year":2022},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:01.371170Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:d0088f4257d2cb84beccd0ed6058c98a7c32b2c0f990dfd803990bd203684fde","observation_id":"1dafea79-6319-40c9-8757-d75adf8e29ef","resolution":{"observed_at":"2026-08-05T22:19:06.538955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:06.044503Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":"30a5f4c6-7a93-4441-839d-398585e4e76a","year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:01.507690Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:43ea63d6f990371b8f2a8027ebaaab0d8ad869c622f8a9f5461a21d159f154bc","observation_id":"add265d2-c0c9-41b1-84ba-4cc16fbbbcf8","resolution":{"observed_at":"2026-08-05T22:19:06.201026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:05.748734Z","title":"Dawn of the transformer era in speech emotion recognition: Closing the valence gap,","venue":null,"work_id":"36d43d7d-3112-4182-9b08-46685e077e29","year":2023},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:01.664852Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:a082343aa2c1d3fb267ab4c6f6427859783e1f44785e503fc91abbe1900a9518","observation_id":"1e1bcdfa-e379-4a72-b7ea-215da3a5e14d","resolution":{"observed_at":"2026-08-05T22:19:05.918481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:05.376383Z","title":"Whis- perX: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":"eedcce9b-65e4-4742-85cc-e66150d61fab","year":2023},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:01.765730Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:46c55232b4db684888e1e3e79652a3f73c8394ebc99176a201c65cf793b43ee3","observation_id":"4afd48f4-8dce-4d01-844d-81078dea12cf","resolution":{"observed_at":"2026-08-05T22:19:05.565564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:05.098768Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks,","venue":null,"work_id":"511a8f6b-4c34-4753-ab70-834619229134","year":2019},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:01.901008Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:0840dd3718868df2fe51e7a30fb81012ee31f9e2767f38ee795a3b79c4a2cb7a","observation_id":"ee166452-0ddc-4232-907a-c0e509467641","resolution":{"observed_at":"2026-08-05T22:19:05.239830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09818","last_updated":"2025-01-16T03:29:23Z","snapshot_observed_at":"2026-08-14T16:20:21.698721Z","submitted_at":"2024-12-13T03:15:05Z","title":"MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09818","snapshot_observed_at":"2026-08-05T22:19:02.006029Z","title":"MERaLiON-AudioLLM: Technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:02.006029Z"},"links":{"cited_paper":"/paper/2412.09818","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:14fbd6bdcb1f24243d9c1eb7aa97e51ed6e208137097a88bbf4320881e592959","observation_id":"b3964042-d69d-4891-8c9f-0de663cf8d1a","resolution":{"observed_at":"2026-08-05T22:19:02.006029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:04.831896Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":"839da549-df1b-49d2-91ee-97a65e9dfdf9","year":2023},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:02.191735Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:0558262fb330240a00ca213c0f2fef2709191be42da78c371507ac7f81f792f0","observation_id":"86bc0bfb-bce2-4a74-a663-beb72b7a2b4a","resolution":{"observed_at":"2026-08-05T22:19:04.928009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T22:19:02.331972Z","title":"Gemma: Open models based on gemini research and technol- ogy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:02.331972Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:1e67589308c964eb3d5c72ed9a9468e7298a2283321fc96948f4340f16af5d1f","observation_id":"7d080e31-18cc-48e8-8da7-b94a6389b350","resolution":{"observed_at":"2026-08-05T22:19:02.331972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01034","last_updated":"2025-01-11T03:47:08Z","snapshot_observed_at":"2026-08-14T10:48:07.529275Z","submitted_at":"2025-01-02T03:28:52Z","title":"Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01034","snapshot_observed_at":"2026-08-05T22:19:02.450512Z","title":"Advancing Singlish understanding: Bridging the gap with datasets and multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:02.450512Z"},"links":{"cited_paper":"/paper/2501.01034","citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:687a5f5bee28a3095be4daeba88bcf6049e30f42eb895508d28ba2b00f906cd4","observation_id":"d0ce1fd1-838f-4d9e-8d6e-d592d06956e6","resolution":{"observed_at":"2026-08-05T22:19:02.450512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:04.595548Z","title":"Building the Singapore English national speech corpus,","venue":null,"work_id":"a50d13b1-c12b-4d63-8a02-0483791eb145","year":2019},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:02.570145Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:5ba85d66d5fa56de3deb58e987d874ab4220bc1df9870b04314af89147696ba2","observation_id":"3c5d796a-1369-4324-b30d-6519a858bcf1","resolution":{"observed_at":"2026-08-05T22:19:04.706734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:04.289761Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"c1c0018b-2995-4c2c-9e4f-bd64f44f6e53","year":2015},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:02.725176Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:bb008addcd6bdb28d7a388db660412956013b4d992026f950cbc42746b814e57","observation_id":"91c7c5e1-003d-4014-8862-e8d6e77e61ec","resolution":{"observed_at":"2026-08-05T22:19:04.426180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:04.039627Z","title":"IEMOCAP: interactive emotional dyadic motion capture database,","venue":null,"work_id":"b5f50f35-bc44-42df-9c02-5afc289a3e8b","year":2008},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:02.841800Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:9213f7494d3a8725b3091206bdeb7e805571076915928f18a66a7f5f702f7c8b","observation_id":"3dfe46cb-0dd2-4c44-8e9f-04d47fd8a869","resolution":{"observed_at":"2026-08-05T22:19:04.166254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:03.712720Z","title":"V oxceleb: A large-scale speaker identification dataset,","venue":null,"work_id":"fc75ce66-6eb9-442b-aa9f-e0f53167fc99","year":2017},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:03.024584Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:59d795c9f3860e39ea0d57bce9226fe7920fc140b1d666435b23806ce7f152f2","observation_id":"a005d119-3757-45ff-81ab-c69bfe6c25ea","resolution":{"observed_at":"2026-08-05T22:19:03.907253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:19:03.451773Z","title":"The MSP-Podcast corpus for speech emotion recognition,","venue":null,"work_id":"b3f3ff3e-2c0f-4719-a65e-11333f5926db","year":2023},"citing_paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T22:19:03.131803Z"},"links":{"citing_paper":"/paper/2508.07273"},"observation_digest":"sha256:7e8140139f1f3348e7cf2228a097a5fc31da01ebcfcde1b7d5fdcebe26a66d69","observation_id":"ce965b70-3779-478a-972c-2ff491567a98","resolution":{"observed_at":"2026-08-05T22:19:03.588814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.07273","last_updated":"2025-08-10T10:03:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T16:33:26.259261Z","submitted_at":"2025-08-10T10:03:30Z","title":"Incorporating Contextual Paralinguistic Understanding in Large Speech-Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2508.07273."}