{"as_of":"2026-08-04T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e634a4691164d74236e5059717e2cc92b32b8745aca29f7a9e9068467002072f","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T16:27:37.596817Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T16:27:37.596817Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-18T16:31:37.277945Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"cited_work":{"arxiv_id":"2509.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.14804","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","venue":"cs.SD","work_id":"c57874a6-7731-4151-bb1f-6b15a90962a5","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2509.14804","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:d4095a9a4d9c7a67cec9cb373bcc379a4506c315b83049c393e4d435d23cfdb4","observation_id":"37cf92eb-eb84-4c8b-ac53-9d05791273a2","resolution":{"observed_at":"2026-05-18T16:31:37.281235Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"cited_work":{"arxiv_id":"2509.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.14804","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","venue":"cs.SD","work_id":"c57874a6-7731-4151-bb1f-6b15a90962a5","year":2025},"citing_paper":{"arxiv_id":"2604.11110","last_updated":"2026-04-28T14:02:33Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T07:25:17Z","title":"Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:41.892208Z"},"links":{"cited_paper":"/paper/2509.14804","citing_paper":"/paper/2604.11110"},"observation_digest":"sha256:f40a206c6fd1976017953b42f7ae044c1285627e94df3dc9cb2c9a0313b25b4c","observation_id":"86ec59f5-cb56-48dd-90b1-9786394e7bae","resolution":{"observed_at":"2026-05-11T09:31:06.527206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.14804/citation-record","integrity":"/paper/2509.14804/integrity","json":"/paper/2509.14804/citation-record.json","paper":"/paper/2509.14804"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"cited_work":{"arxiv_id":"2509.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.14804","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","venue":"cs.SD","work_id":"c57874a6-7731-4151-bb1f-6b15a90962a5","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2509.14804","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:d4095a9a4d9c7a67cec9cb373bcc379a4506c315b83049c393e4d435d23cfdb4","observation_id":"37cf92eb-eb84-4c8b-ac53-9d05791273a2","resolution":{"observed_at":"2026-05-18T16:31:37.281235Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To extract rich speech represen- tations and support multitask requirements, we continue pretraining a multilingual SSL XLSR model on readily available unlabeled speech","venue":null,"work_id":"f16f1dc3-78da-466d-9f82-cbb4cb336879","year":null},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:074fd805e61db75f6af05f761a41013393555449fcd5f2a9d9bc9d0eb256dcc7","observation_id":"bfa93736-5e24-489a-995b-03f2ff9374e5","resolution":{"observed_at":"2026-05-18T16:32:45.408474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e56ff8e8-b450-4fb1-a8c7-b970aae5179a","year":null},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:8b2eeafa4584671170527b10994d172f0528f56ed11afc086f06398694cdb6d9","observation_id":"19ed7666-5217-48af-ab88-42d2532c3999","resolution":{"observed_at":"2026-05-18T16:32:45.405067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9d1a2ead-3993-4c84-bc4a-b1830adc9f82","year":null},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:1241645fcd2195ed53e311529879948aebac481177b93fc4a2568c0f132f1866","observation_id":"0cff94d7-9c47-4722-9d31-d29c68715277","resolution":{"observed_at":"2026-05-18T16:32:45.428470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0dcc20d3-7eba-4cd5-a31a-aba3c8da93e4","year":null},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:456a23c99a42d5318c803c769bbd6b8979dabf96c8d0192b34b32349d01de64c","observation_id":"bcec76a0-f450-415f-919c-46f0763de14b","resolution":{"observed_at":"2026-05-18T16:32:45.425268Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Giga2 Test","venue":null,"work_id":"4887d001-d002-46e0-9b50-c686bc214f68","year":2023},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:bea951f334692fabad60ae2e925d6d4556f8fdfbecf433fe306bb0a7337963a9","observation_id":"bbbb7a75-f959-41cb-8c6a-05d811f124a7","resolution":{"observed_at":"2026-05-18T16:32:45.415360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ba3d0e1d-a817-4891-976b-e72f992b46ce","year":2000},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:39df4924bbe14e516ed1a9a72b0066e38c1bdef3a4cf89a0333314eb90fd1035","observation_id":"1a3d152f-fd09-4d29-8ce9-cce669c3bb24","resolution":{"observed_at":"2026-05-18T16:32:45.418578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0f092e7-b162-40fe-bd8b-894a5110ae0c","year":null},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:3791fdcf17fa7aaec997e3e04e2a5ed415bf27e06aaafdc9dedd4a8861d83905","observation_id":"8fcd6653-12f5-4b5e-ad96-2f5ab9e09edd","resolution":{"observed_at":"2026-05-18T16:32:45.421882Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:0310ab25880bc5112aaf1b3a72ce7155573fb8b8619fd031d43a13952605eee4","observation_id":"2d685b73-3a01-4bf0-a409-2f3b50eaefe9","resolution":{"observed_at":"2026-05-18T16:31:37.200214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:e147671ec0d0a5dbf1a36cf8b30fcd599ef23531d98c2c47a6ca97483535470f","observation_id":"7050ce9a-e043-498f-9814-55fe49077028","resolution":{"observed_at":"2026-05-18T16:31:37.274058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:cd49f9c2fc9ecfd13f9a588c6d1c08959d7e1118bd50d579b78a264e84e89a99","observation_id":"ff55fc10-145d-47d9-a655-bc7e609b9c62","resolution":{"observed_at":"2026-05-18T16:31:37.246569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-07-10T12:57:07.670593Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:e064404d3bc0f276aaf044ef737426d6421fd7d2d32b008dd49b04f1b0a0bb69","observation_id":"8a7931aa-9b85-4f9f-9d7c-490653cc6fb0","resolution":{"observed_at":"2026-05-18T16:31:37.214337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2504.18425","doi":"10.48550/arxiv.2504.18425","metadata_source":"pith","pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Kimi-Audio Technical Report","venue":"eess.AS","work_id":"9c2ba56b-5585-4f28-b751-703f31dca2d5","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:cfe692308999218efcfb37189b8f5537e27d2bb04ce4864e557284806b296f28","observation_id":"92edd316-7874-46cc-83ef-472a92329881","resolution":{"observed_at":"2026-05-18T16:31:37.267356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-07-06T20:41:42.199592Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":"2502.17239","doi":"10.48550/arxiv.2502.17239","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Baichuan-audio: A unified frame- work for end-to-end speech interaction","venue":null,"work_id":"25a6088f-2ca9-49d8-b299-f92bba182d1e","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:f2af1e58ba83eb7ed1a8efa6b64aa50161bd80ca3ab9853c1dc35d18c896bbd7","observation_id":"6926b130-d033-4f16-badd-5e1c9729d192","resolution":{"observed_at":"2026-05-18T16:31:37.190198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-07-06T21:29:45.699731Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"cited_work":{"arxiv_id":"2505.18644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18644","snapshot_observed_at":"2026-07-03T15:18:32.647414Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behav- ior Imitation and Speech-Text Interleaving","venue":null,"work_id":"85886815-17a2-4bb8-a94a-64535e9a3824","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2505.18644","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:7d65771c943ad91711e7df139e76eb0d9ecc5c3fc8ef7b12c2d5edece9447b6d","observation_id":"7287100f-cfe4-4531-b7de-b1e9b85c8023","resolution":{"observed_at":"2026-05-18T16:31:37.195229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-07-10T20:27:36.606337Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:ff93de0f6e4e4ad630a96ba0e9c7a86af7bb506a46f913948dc2e8803930ee3a","observation_id":"1cd5ced8-1692-4beb-8b08-f654536cbb5a","resolution":{"observed_at":"2026-05-18T16:31:37.256969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-07-06T22:18:07.507793Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"cited_work":{"arxiv_id":"2508.17863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17863","snapshot_observed_at":"2026-07-03T07:27:44.920929Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spo- ken Language Understanding in SpeechLLMs","venue":null,"work_id":"955ccaa6-1a25-4412-b5ca-1a601446917d","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2508.17863","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:77cd3a25e5692e60875a1da5506c924b0a55671293bd32239db94d1701ee5599","observation_id":"5e0eb325-70d6-4597-a064-93b3bef5b1ae","resolution":{"observed_at":"2026-05-18T16:31:37.222863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":"2412.02612","doi":"10.48550/arxiv.2412.02612","metadata_source":"pith","pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","venue":"cs.CL","work_id":"1d250ff4-6ca5-4eb5-b561-48106b630d8b","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:a873ce0e99725bf82232ac8c01f3ae9850fe1d65542986c1b9f75e9375d6f597","observation_id":"b720b867-8b51-4b57-821a-a6cd1d1ae847","resolution":{"observed_at":"2026-05-18T16:31:37.251470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:fabf16aa026d5195e70d816292ea89459641a8b80a0c770c160d923f45dcdc04","observation_id":"050ac82d-14d1-4658-bac8-7b4904c2fa6e","resolution":{"observed_at":"2026-05-18T16:31:37.205947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.07053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T11:45:47.179684Z","title":"TASTE: Text-Aligned Speech To- kenization and Embedding for Spoken Language Modeling","venue":null,"work_id":"26350df2-5cea-4824-9a93-374f7c0d086a","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:9cfdcc56885fb40025c70b3b77557ba19e88844f2ea6dc571707a0192d1e3bf3","observation_id":"8894e950-3020-49ca-9575-86dddec8e89a","resolution":{"observed_at":"2026-05-18T16:31:37.185120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Mod- els","venue":null,"work_id":"de654890-cffa-40a5-aff9-f38c1710a5f4","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:38777b08e620dbe4f2b2c4286a04ae608ce8543935f3a75d154570a1ae5bf822","observation_id":"8e507a9a-fb18-426f-9b01-fd7b5e506ef5","resolution":{"observed_at":"2026-05-18T16:32:45.435859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets","venue":null,"work_id":"0d7dcccd-4139-4449-9e54-5e171c0ed4f1","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:50b89fbe52fa9337ac8405fdfc297fee1d8e8f3e058fcba949e7a03fd158210d","observation_id":"652210ae-bf64-44aa-bd94-05f4a537f8c0","resolution":{"observed_at":"2026-05-18T16:32:45.443475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04096","last_updated":"2025-08-06T05:28:18Z","snapshot_observed_at":"2026-07-06T22:08:31.972626Z","submitted_at":"2025-08-06T05:28:18Z","title":"Efficient Scaling for LLM-based ASR","version":1},"cited_work":{"arxiv_id":"2508.04096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04096","snapshot_observed_at":"2026-07-03T15:18:32.664428Z","title":"Efficient Scaling for LLM-based ASR","venue":null,"work_id":"458086c4-7dd9-4e2d-8b5c-4a46e46f9d96","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2508.04096","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:2530c6e24fe1ea14389edb08fc570670c03cbe43f1bc59c2a68cd4bdac828ee3","observation_id":"f38737e3-6cba-4b9d-9031-e492d7d10278","resolution":{"observed_at":"2026-05-18T16:31:37.237746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":"1ed9fb74-5c6e-4733-be46-73bd3d96e068","year":2023},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:62fb1f95fbf35a935d61c0d2c2062ee047d3739073bf3806e0bfe8eafb973711","observation_id":"6e688816-347c-4852-acfd-4dbdb1df2628","resolution":{"observed_at":"2026-05-18T16:32:45.412046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22063","last_updated":"2025-05-28T07:39:25Z","snapshot_observed_at":"2026-08-02T01:39:18.965075Z","submitted_at":"2025-05-28T07:39:25Z","title":"Weakly Supervised Data Refinement and Flexible Sequence Compression for Efficient Thai LLM-based ASR","version":1},"cited_work":{"arxiv_id":"2505.22063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22063","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weakly supervised data refinement and flexible sequence compression for efficient thai llm-based ASR","venue":null,"work_id":"2c3228d4-c8b7-415e-b2e2-b01e6ba43dbf","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2505.22063","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:7176e06aa6e62ec7a8d6878bd0ad4baf69ee81cafa3e70cecb7702ec3ffddfae","observation_id":"8343647e-129e-4658-bc6f-18c912e44ef8","resolution":{"observed_at":"2026-05-18T16:31:37.218556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13306","last_updated":"2025-02-16T08:03:17Z","snapshot_observed_at":"2026-07-06T20:24:44.865798Z","submitted_at":"2025-01-23T01:27:46Z","title":"OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia","version":2},"cited_work":{"arxiv_id":"2501.13306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13306","snapshot_observed_at":"2026-07-04T11:49:50.788200Z","title":"OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia","venue":null,"work_id":"45f98848-4dc2-4c34-9aac-786ca4cd4ace","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2501.13306","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:fdff57832b5a2d35ef1ff463f6f681ad57faf3791547600af72a7a3f58e82878","observation_id":"93284ac9-394a-42dc-9ced-1d4b75bc47dd","resolution":{"observed_at":"2026-05-18T16:31:37.228057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","venue":null,"work_id":"90240fe9-6a1b-4bd5-b20f-074162266c33","year":2022},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:1c26f52375088d01ea32fe1dced244224045aa434911465bb1c8a7f16afe509f","observation_id":"62c6e0bb-dc4c-4088-b0a4-cdbda7289aea","resolution":{"observed_at":"2026-05-18T16:32:45.439676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13702","last_updated":"2024-12-19T17:36:38Z","snapshot_observed_at":"2026-07-06T20:09:10.465980Z","submitted_at":"2024-12-18T10:45:24Z","title":"Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models","version":2},"cited_work":{"arxiv_id":"2412.13702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13702","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Typhoon 2: A Family of Open Text and Multimodal Thai Large Lan- guage Models","venue":null,"work_id":"e50e8016-908a-4173-b549-4ac16d7a8eac","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2412.13702","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:40584dc22827830d042b6a49063334a9edb5bebea0f0979a33741fd1cb2f39f7","observation_id":"4f7c7ab8-2a3a-4871-a4d9-7787a078a5cd","resolution":{"observed_at":"2026-05-18T16:31:37.210307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-07-06T22:10:40.258498Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":"2508.07302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07302","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","venue":null,"work_id":"e4d08037-aa7f-4f18-8cf5-f5434910e1ee","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2508.07302","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:d47dc66d582f9a2776058e2f6342eab571826000477fdf60d04735354b90cc1d","observation_id":"a8438032-1c43-4fd7-a270-741ef50b734a","resolution":{"observed_at":"2026-05-18T16:31:37.262268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11546","last_updated":"2025-05-27T04:49:35Z","snapshot_observed_at":"2026-07-06T18:32:11.091893Z","submitted_at":"2024-06-17T13:44:20Z","title":"GigaSpeech 2: An Evolving, Large-Scale and Multi-domain ASR Corpus for Low-Resource Languages with Automated Crawling, Transcription and Refinement","version":2},"cited_work":{"arxiv_id":"2406.11546","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11546","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GigaSpeech 2: An Evolving, Large- Scale and Multi-domain ASR Corpus for Low-Resource Lan- guages with Automated Crawling, Transcription and Refine- ment","venue":null,"work_id":"f853b38a-ccec-4426-a184-503a5f935524","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2406.11546","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:8ade358d9349fb9ff637bdc05f03d989bd513dc352045383b1c4c5d7c5f478a7","observation_id":"15254c82-8fde-4ccc-a224-12a3523f118c","resolution":{"observed_at":"2026-05-18T16:31:37.242377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18301","last_updated":"2024-06-26T12:35:12Z","snapshot_observed_at":"2026-07-06T18:37:17.280637Z","submitted_at":"2024-06-26T12:35:12Z","title":"MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Audio for Speech Recognition Research","version":1},"cited_work":{"arxiv_id":"2406.18301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18301","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MSR-86K: An Evolving, Multilingual Corpus with 86,300 Hours of Transcribed Au- dio for Speech Recognition Research","venue":null,"work_id":"e90ff521-da71-4320-af60-2254ceade0b1","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2406.18301","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:9d1a662ee2b475e53ba075025f7650cb44164d9f6a9c693497d058d5fcb95a72","observation_id":"d2c80595-9118-415f-b188-53d905fc1546","resolution":{"observed_at":"2026-05-18T16:31:37.233096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Common V oice: A Massively-Multilingual Speech Corpus","venue":null,"work_id":"072f7276-8340-4b87-a695-fd4b3cda2a2a","year":2020},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:0e903c7b703908c66bb5bc5db2e0f73bc373ad1de3ea6c081b9e19fc418a488b","observation_id":"f2a148e1-c25a-4a04-91fe-f50ffc527646","resolution":{"observed_at":"2026-05-18T16:32:45.432084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-02T01:27:09.355801Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":4,"verified_exact":19,"verified_fuzzy":7},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 2 inbound Pith citation observations for arXiv:2509.14804."}