Pith. sign in

Paper Citation Record · LEDGER

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages

As of 3 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 2 inbound Pith citation observations for arXiv:2509.14804.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.14804 v1

Coverage vector

measured 32 of 32 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-18T16:27:37.596817Z

measured 34 of 34 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-03T06:30:56.289259+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-18T16:27:37.596817Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-05-18T16:31:37.277945Z

Reference resolution

32 of 32 outbound references displayed

  • verified exact19
  • verified fuzzy7
  • unresolved4
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 37cf92eb-eb84-4c8b-ac53-9d05791273a2 · outbound

This paper cites Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-05-18T16:31:37.281235Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:d4095a9a4d9c7a67cec9cb373bcc379a4506c315b83049c393e4d435d23cfdb4

Observation bfa93736-5e24-489a-995b-03f2ff9374e5 · outbound

This paper cites To extract rich speech represen- tations and support multitask requirements, we continue pretraining a multilingual SSL XLSR model on readily available unlabeled speech.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages To extract rich speech represen- tations and support multitask requirements, we continue pretraining a multilingual SSL XLSR model on readily available unlabeled speech

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T16:32:45.408474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:074fd805e61db75f6af05f761a41013393555449fcd5f2a9d9bc9d0eb256dcc7

Observation 19ed7666-5217-48af-ab88-42d2532c3999 · outbound

This paper cites an unresolved cited work.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-05-18T16:32:45.405067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:8b2eeafa4584671170527b10994d172f0528f56ed11afc086f06398694cdb6d9

Observation 0cff94d7-9c47-4722-9d31-d29c68715277 · outbound

This paper cites an unresolved cited work.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-05-18T16:32:45.428470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:1241645fcd2195ed53e311529879948aebac481177b93fc4a2568c0f132f1866

Observation bcec76a0-f450-415f-919c-46f0763de14b · outbound

This paper cites an unresolved cited work.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Unresolved cited work

Reference 5

Resolution
parse uncertain
raw_fallback, observed 2026-05-18T16:32:45.425268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:456a23c99a42d5318c803c769bbd6b8979dabf96c8d0192b34b32349d01de64c

Observation bbbb7a75-f959-41cb-8c6a-05d811f124a7 · outbound

This paper cites Giga2 Test.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Giga2 Test

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T16:32:45.415360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:bea951f334692fabad60ae2e925d6d4556f8fdfbecf433fe306bb0a7337963a9

Observation 1a3d152f-fd09-4d29-8ce9-cce669c3bb24 · outbound

This paper cites an unresolved cited work.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-05-18T16:32:45.418578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:39df4924bbe14e516ed1a9a72b0066e38c1bdef3a4cf89a0333314eb90fd1035

Observation 8fcd6653-12f5-4b5e-ad96-2f5ab9e09edd · outbound

This paper cites an unresolved cited work.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-05-18T16:32:45.421882Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:3791fdcf17fa7aaec997e3e04e2a5ed415bf27e06aaafdc9dedd4a8861d83905

Observation 2d685b73-3a01-4bf0-a409-2f3b50eaefe9 · outbound

This paper cites GPT-4 Technical Report.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages GPT-4 Technical Report

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-18T16:31:37.200214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:0310ab25880bc5112aaf1b3a72ce7155573fb8b8619fd031d43a13952605eee4

Observation 7050ce9a-e043-498f-9814-55fe49077028 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-05-18T16:31:37.274058Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:e147671ec0d0a5dbf1a36cf8b30fcd599ef23531d98c2c47a6ca97483535470f

Observation ff55fc10-145d-47d9-a655-bc7e609b9c62 · outbound

This paper cites Qwen2 Technical Report.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Qwen2 Technical Report

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-18T16:31:37.246569Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:cd49f9c2fc9ecfd13f9a588c6d1c08959d7e1118bd50d579b78a264e84e89a99

Observation 8a7931aa-9b85-4f9f-9d7c-490653cc6fb0 · outbound

This paper cites Qwen2-Audio Technical Report.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Qwen2-Audio Technical Report

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-05-18T16:31:37.214337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:e064404d3bc0f276aaf044ef737426d6421fd7d2d32b008dd49b04f1b0a0bb69

Observation 92edd316-7874-46cc-83ef-472a92329881 · outbound

This paper cites Kimi-Audio Technical Report.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Kimi-Audio Technical Report

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-05-18T16:31:37.267356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:cfe692308999218efcfb37189b8f5537e27d2bb04ce4864e557284806b296f28

Observation 6926b130-d033-4f16-badd-5e1c9729d192 · outbound

This paper cites Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.190198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:f2af1e58ba83eb7ed1a8efa6b64aa50161bd80ca3ab9853c1dc35d18c896bbd7

Observation 7287100f-cfe4-4531-b7de-b1e9b85c8023 · outbound

This paper cites Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.195229Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:7d65771c943ad91711e7df139e76eb0d9ecc5c3fc8ef7b12c2d5edece9447b6d

Observation 1cd5ced8-1692-4beb-8b08-f654536cbb5a · outbound

This paper cites Voxtral.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Voxtral

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.256969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:ff93de0f6e4e4ad630a96ba0e9c7a86af7bb506a46f913948dc2e8803930ee3a

Observation 5e0eb325-70d6-4597-a064-93b3bef5b1ae · outbound

This paper cites Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.222863Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:77cd3a25e5692e60875a1da5506c924b0a55671293bd32239db94d1701ee5599

Observation b720b867-8b51-4b57-821a-a6cd1d1ae847 · outbound

This paper cites GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-05-18T16:31:37.251470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:a873ce0e99725bf82232ac8c01f3ae9850fe1d65542986c1b9f75e9375d6f597

Observation 050ac82d-14d1-4658-bac8-7b4904c2fa6e · outbound

This paper cites Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.205947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:fabf16aa026d5195e70d816292ea89459641a8b80a0c770c160d923f45dcdc04

Observation 8894e950-3020-49ca-9575-86dddec8e89a · outbound

This paper cites TASTE: Text-Aligned Speech To- kenization and Embedding for Spoken Language Modeling.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages TASTE: Text-Aligned Speech To- kenization and Embedding for Spoken Language Modeling

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.185120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:9cfdcc56885fb40025c70b3b77557ba19e88844f2ea6dc571707a0192d1e3bf3

Observation 8e507a9a-fb18-426f-9b01-fd7b5e506ef5 · outbound

This paper cites SALMONN: Towards Generic Hearing Abilities for Large Language Mod- els.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages SALMONN: Towards Generic Hearing Abilities for Large Language Mod- els

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T16:32:45.435859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:38777b08e620dbe4f2b2c4286a04ae608ce8543935f3a75d154570a1ae5bf822

Observation 652210ae-bf64-44aa-bd94-05f4a537f8c0 · outbound

This paper cites Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T16:32:45.443475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:50b89fbe52fa9337ac8405fdfc297fee1d8e8f3e058fcba949e7a03fd158210d

Observation f38737e3-6cba-4b9d-9031-e492d7d10278 · outbound

This paper cites Efficient Scaling for LLM-based ASR.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Efficient Scaling for LLM-based ASR

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.237746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:2530c6e24fe1ea14389edb08fc570670c03cbe43f1bc59c2a68cd4bdac828ee3

Observation 6e688816-347c-4852-acfd-4dbdb1df2628 · outbound

This paper cites Robust Speech Recognition via Large-Scale Weak Supervision.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Robust Speech Recognition via Large-Scale Weak Supervision

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T16:32:45.412046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:62fb1f95fbf35a935d61c0d2c2062ee047d3739073bf3806e0bfe8eafb973711

Observation 8343647e-129e-4658-bc6f-18c912e44ef8 · outbound

This paper cites Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.218556Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:7176e06aa6e62ec7a8d6878bd0ad4baf69ee81cafa3e70cecb7702ec3ffddfae

Observation 93284ac9-394a-42dc-9ced-1d4b75bc47dd · outbound

This paper cites OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.228057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:fdff57832b5a2d35ef1ff463f6f681ad57faf3791547600af72a7a3f58e82878

Observation 62c6e0bb-dc4c-4088-b0a4-cdbda7289aea · outbound

This paper cites XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T16:32:45.439676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:1c26f52375088d01ea32fe1dced244224045aa434911465bb1c8a7f16afe509f

Observation 4f7c7ab8-2a3a-4871-a4d9-7787a078a5cd · outbound

This paper cites Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.210307Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:40584dc22827830d042b6a49063334a9edb5bebea0f0979a33741fd1cb2f39f7

Observation a8438032-1c43-4fd7-a270-741ef50b734a · outbound

This paper cites XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.262268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:d47dc66d582f9a2776058e2f6342eab571826000477fdf60d04735354b90cc1d

Observation 15254c82-8fde-4ccc-a224-12a3523f118c · outbound

This paper cites GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.242377Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:8ade358d9349fb9ff637bdc05f03d989bd513dc352045383b1c4c5d7c5f478a7

Observation d2c80595-9118-415f-b188-53d905fc1546 · outbound

This paper cites MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-18T16:31:37.233096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:9d1a662ee2b475e53ba075025f7650cb44164d9f6a9c693497d058d5fcb95a72

Observation f2a148e1-c25a-4a04-91fe-f50ffc527646 · outbound

This paper cites Common V oice: A Massively-Multilingual Speech Corpus.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Common V oice: A Massively-Multilingual Speech Corpus

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-18T16:32:45.432084Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:0e903c7b703908c66bb5bc5db2e0f73bc373ad1de3ea6c081b9e19fc418a488b

Pith citing papers

Observation 37cf92eb-eb84-4c8b-ac53-9d05791273a2 · inbound

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages cites this paper.

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages

Reference 1

Resolution
metadata mismatch
local_arxiv, observed 2026-05-18T16:31:37.281235Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-18T16:27:37.596817Z digest=sha256:d4095a9a4d9c7a67cec9cb373bcc379a4506c315b83049c393e4d435d23cfdb4

Observation 86ec59f5-cb56-48dd-90b1-9786394e7bae · inbound

Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan cites this paper.

Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-05-11T09:31:06.527206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.

source=pdf_text observed=2026-05-10T15:57:41.892208Z digest=sha256:f40a206c6fd1976017953b42f7ae044c1285627e94df3dc9cb2c9a0313b25b4c