{"as_of":"2026-08-09T06:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:218e098b53bdda4c021927f0390efcce84ef96bc803f8f76f91f61c40810a9bf","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:30:33.802965Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:30:30.787397Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:18:32.647414Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18644","snapshot_observed_at":"2026-08-07T14:30:30.787397Z","title":"Hope you<Interleaved Speech>","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:30.787397Z"},"links":{"cited_paper":"/paper/2505.18644","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:48fe27c4937a5586d719f485c2cced088e6449bcccc00aa58bbaf0fcba97e1ba","observation_id":"29bcc073-b6fb-49c1-8391-64c9f9a48992","resolution":{"observed_at":"2026-08-07T14:30:30.787397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"cited_work":{"arxiv_id":"2505.18644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18644","snapshot_observed_at":"2026-07-03T15:18:32.647414Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behav- ior Imitation and Speech-Text Interleaving","venue":null,"work_id":"85886815-17a2-4bb8-a94a-64535e9a3824","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-07T14:31:44.422604Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2505.18644","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:60d5518d508a3a8a09b9aea36ee6ce12acd7b392a51a46231462a26fd67ef518","observation_id":"7287100f-cfe4-4531-b7de-b1e9b85c8023","resolution":{"observed_at":"2026-05-18T16:31:37.195229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"cited_work":{"arxiv_id":"2505.18644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18644","snapshot_observed_at":"2026-07-03T15:18:32.647414Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behav- ior Imitation and Speech-Text Interleaving","venue":null,"work_id":"85886815-17a2-4bb8-a94a-64535e9a3824","year":2025},"citing_paper":{"arxiv_id":"2607.01733","last_updated":"2026-07-02T05:42:01Z","snapshot_observed_at":"2026-08-06T21:21:57.811880Z","submitted_at":"2026-07-02T05:42:01Z","title":"Rethinking Speech-LLM Integration for ASR: Effective Joint Speech-Text Training by Interleaving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-03T15:17:52.966144Z"},"links":{"cited_paper":"/paper/2505.18644","citing_paper":"/paper/2607.01733"},"observation_digest":"sha256:2ca970260675c4551b30b71a0c0cebb24703618d9dcaa1f8d882499601fa2c5d","observation_id":"ed1c8b03-cc89-4e2c-9120-56f69f53ecad","resolution":{"observed_at":"2026-07-03T15:18:32.648961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18644/citation-record","integrity":"/paper/2505.18644/integrity","json":"/paper/2505.18644/citation-record.json","paper":"/paper/2505.18644"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:35.722958Z","title":null,"venue":null,"work_id":"c11feebe-97da-4f4a-9c88-bb69bb073a22","year":null},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:30.765642Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:48acc9e9cb2bf5233aa4d3db9bdc385dfe246713f977394758f13e9e58ca7d57","observation_id":"d6f7a767-4caf-45ff-b453-1200e26d4611","resolution":{"observed_at":"2026-08-07T14:30:35.801501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18644","snapshot_observed_at":"2026-08-07T14:30:30.787397Z","title":"Hope you<Interleaved Speech>","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:30.787397Z"},"links":{"cited_paper":"/paper/2505.18644","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:48fe27c4937a5586d719f485c2cced088e6449bcccc00aa58bbaf0fcba97e1ba","observation_id":"29bcc073-b6fb-49c1-8391-64c9f9a48992","resolution":{"observed_at":"2026-08-07T14:30:30.787397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:35.459201Z","title":"To address this gap, we draw inspiration from estab- lished evaluation methods in NLP [15, 16]","venue":null,"work_id":"cf6555dd-f13e-41bb-bdbb-42f4adfe5b27","year":null},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:30.917143Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:ebe9b077e0b671d309ed0cd0e6bcd5a9906d3d4bcd3c335afdb5a4deab988e70","observation_id":"efcfb8a1-59cb-4dd6-85fe-dd4e942a6caf","resolution":{"observed_at":"2026-08-07T14:30:35.600996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:35.296256Z","title":"This task evaluates both the instruction following and reasoning abilities of SLLMs","venue":null,"work_id":"d1f63dbc-f3bd-479f-8004-a927d0675f4b","year":null},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.039709Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:e2dbd73c8d855c8f5b62438cda43d3b2464bf1bb7b3e32cab60e80bc84697366","observation_id":"776bc234-ea5e-482a-96f5-3c403db46458","resolution":{"observed_at":"2026-08-07T14:30:35.372184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:35.097617Z","title":null,"venue":null,"work_id":"0ef8e2a4-6af6-411e-aa35-39c11f4cc5b0","year":null},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.169989Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:93035a91f767573ae27a26cd1b0316adc3cc6412a093d709d85a216b7e51712e","observation_id":"9c694860-f940-4deb-abbe-bda9cda12159","resolution":{"observed_at":"2026-08-07T14:30:35.179258Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:34.891218Z","title":null,"venue":null,"work_id":"2955f203-fd37-4f19-a00e-fd02cbcef2b7","year":null},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.303114Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:de65697db239152f584678977b56628a44dc00624d0e2e2adaba91d1556abeb8","observation_id":"59c2f1a1-8650-421c-b3bd-3ebf8996c151","resolution":{"observed_at":"2026-08-07T14:30:34.979967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:30:31.425290Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.425290Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:8937ac3774ed5878b764acd43a7815aff1ed438dc29e0c18a03d9e09a025e14f","observation_id":"8b715cbe-a44f-461b-90ea-9e4169c7cd5a","resolution":{"observed_at":"2026-08-07T14:30:31.425290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:30:31.517878Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.517878Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:bdad1ed9f7ea91239698e8d3663641d775e2037ffee3412d243bd99ce7a0b7ed","observation_id":"59cf28db-b5e6-4a48-9849-38e855f68801","resolution":{"observed_at":"2026-08-07T14:30:31.517878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-07T14:30:31.589269Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.589269Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:04ed716060cd8aca2269b70a9f70fb84a398a3260485b3d59345c3c9087c09da","observation_id":"88cc677d-846b-40eb-980f-c20e16e3560f","resolution":{"observed_at":"2026-08-07T14:30:31.589269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15930","last_updated":"2023-09-16T06:14:54Z","snapshot_observed_at":"2026-08-05T06:18:44.577926Z","submitted_at":"2023-08-30T10:12:39Z","title":"LLaSM: Large Language and Speech Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15930","snapshot_observed_at":"2026-08-07T14:30:31.680423Z","title":"Llasm: Large language and speech model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.680423Z"},"links":{"cited_paper":"/paper/2308.15930","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:35bcd4275c453a6d85457487d78dbbd41ab21e50e2b6e639d39fc25584b60326","observation_id":"f8e0976e-a24b-468f-853e-bd45b02588c7","resolution":{"observed_at":"2026-08-07T14:30:31.680423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T14:30:31.743024Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.743024Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:561b0e2aa2084cfc1f28a4c0cfbf1cbbf446a0b1ed60497873433016084f1e50","observation_id":"1ba8552a-e7fd-4b57-bbf7-b00540d94683","resolution":{"observed_at":"2026-08-07T14:30:31.743024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T14:30:31.863555Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.863555Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:359d0941620f8772f5186cb370c3f69efa83b6111acfe29eae9aab5c0342b4bb","observation_id":"e3d616bc-cdc1-46f4-b0dc-41353a7b27cb","resolution":{"observed_at":"2026-08-07T14:30:31.863555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T14:30:31.918185Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.918185Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:f67c44977a6cb0232e67c146e5ca02b155844d6babb0acb242a2f5b1f75f0eee","observation_id":"b151d448-45cf-463a-84cd-0e688b996c67","resolution":{"observed_at":"2026-08-07T14:30:31.918185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:31.987984Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:31.987984Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:1ff3faa8fe41773e5b1aaf4e2e5bd72411a23f659cda74212a2f9e97e3678b52","observation_id":"0c85785d-85b2-440a-9d87-e3e9af258536","resolution":{"observed_at":"2026-08-07T14:30:31.987984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:34.739643Z","title":"Multi-task learning in natu- ral language processing: An overview,","venue":null,"work_id":"da591ca8-aced-4b80-b33f-65a1d20d55aa","year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.075506Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:938e4191b62fa113952a71194aa04e4b3444c2d4f132a42d5a0777bf95904d83","observation_id":"cf6e60a3-1e37-4e9e-8eb1-1857748c2ac4","resolution":{"observed_at":"2026-08-07T14:30:34.782094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00916","last_updated":"2024-05-28T14:26:28Z","snapshot_observed_at":"2026-07-06T16:13:34.788427Z","submitted_at":"2023-09-02T11:46:05Z","title":"BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00916","snapshot_observed_at":"2026-08-07T14:30:32.148354Z","title":"Blsp: Bootstrapping language-speech pre-training via behavior alignment of continuation writing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.148354Z"},"links":{"cited_paper":"/paper/2309.00916","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:a0e71780d5e0354ebc03179ebde14e914866099229976bee4f15ccadd89d6e38","observation_id":"94f98aa1-3d84-46a6-a31c-e2f6c2a8f51a","resolution":{"observed_at":"2026-08-07T14:30:32.148354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-07T14:30:32.222856Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.222856Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:29c3dd6a4e90b11985801cfcccfaab720fcf3b4f2a4d4c43341071e55d73a8df","observation_id":"1e9316b4-b1fd-426f-8937-3caf555a31f6","resolution":{"observed_at":"2026-08-07T14:30:32.222856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17607","last_updated":"2024-12-02T16:13:24Z","snapshot_observed_at":"2026-08-07T11:31:39.220259Z","submitted_at":"2024-11-26T17:19:09Z","title":"Scaling Speech-Text Pre-training with Synthetic Interleaved Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17607","snapshot_observed_at":"2026-08-07T14:30:32.280525Z","title":"Scaling speech-text pre-training with synthetic interleaved data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.280525Z"},"links":{"cited_paper":"/paper/2411.17607","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:755e4e436967a3fc6e1a4e51c018073058f189c5edcbe9c2d77396ec2ebec2c0","observation_id":"85c9fb60-1c6d-4d7c-b3dc-f1d49cfd4c94","resolution":{"observed_at":"2026-08-07T14:30:32.280525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-08-08T16:34:49.867190Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-07T14:30:32.356065Z","title":"Spirit-lm: Interleaved spoken and written language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.356065Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:c47ed5ae34490accce911eabd4b0365b8570cfe3d7323ba47dae983068ea056d","observation_id":"d8b4e2b3-bb32-4a29-aea2-75bef8783034","resolution":{"observed_at":"2026-08-07T14:30:32.356065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12488","last_updated":"2024-12-24T08:58:16Z","snapshot_observed_at":"2026-07-06T16:09:48.222394Z","submitted_at":"2023-08-24T01:17:16Z","title":"GPTEval: A Survey on Assessments of ChatGPT and GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12488","snapshot_observed_at":"2026-08-07T14:30:32.434957Z","title":"Gpteval: A survey on assessments of chatgpt and gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.434957Z"},"links":{"cited_paper":"/paper/2308.12488","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:05c161ae7e9c34e0fabc8212b615a99adb55ef3f2306eba35dfacdbca50e2a99","observation_id":"3e1c4023-e4d4-4822-82c5-7a08c715b20a","resolution":{"observed_at":"2026-08-07T14:30:32.434957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T14:30:32.525199Z","title":"Instruction-following evaluation for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.525199Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:34acc7c649540692e8a6ea1acfd1303656f9a6c3684ea6123f86c6ed828b5300","observation_id":"aa2aa27e-4c85-4a5f-89d7-b37a0d651418","resolution":{"observed_at":"2026-08-07T14:30:32.525199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01383","last_updated":"2025-05-14T06:05:53Z","snapshot_observed_at":"2026-08-08T11:17:56.985482Z","submitted_at":"2024-02-02T13:06:35Z","title":"LLM-based NLG Evaluation: Current Status and Challenges","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01383","snapshot_observed_at":"2026-08-07T14:30:32.605080Z","title":"Llm-based nlg evaluation: Current status and challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.605080Z"},"links":{"cited_paper":"/paper/2402.01383","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:e8af3c01ca2e2027439944c8d502b327bccaef81db820226f3b7c436a5aba0fb","observation_id":"d249389f-0cbc-4361-a489-06d8187191c4","resolution":{"observed_at":"2026-08-07T14:30:32.605080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10937","last_updated":"2025-01-19T04:10:53Z","snapshot_observed_at":"2026-07-06T20:22:59.218985Z","submitted_at":"2025-01-19T04:10:53Z","title":"Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10937","snapshot_observed_at":"2026-08-07T14:30:32.689968Z","title":"Leveraging chain of thought towards empathetic spoken dialogue without corresponding question-answering data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.689968Z"},"links":{"cited_paper":"/paper/2501.10937","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:e995e4632052ca9cbbc037bf262552421c6e71ccb5954c02921f74548fd5ecde","observation_id":"bb23efa7-939b-4348-b0bf-242f3a858245","resolution":{"observed_at":"2026-08-07T14:30:32.689968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:32.779482Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.779482Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:81fc1d0919356db4de415a6e13f226317dc721d6bf8976f8780a4e641805263d","observation_id":"03aa659d-143e-4f58-a6c3-dd19882ba531","resolution":{"observed_at":"2026-08-07T14:30:32.779482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-07T14:30:32.843707Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.843707Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:f77e64d3b4730460d76e787bcec4c25c4e62e944b778c518c4e5d04c662abe5e","observation_id":"91e79bc3-cbb2-4c8f-91c3-2f9b851bbdec","resolution":{"observed_at":"2026-08-07T14:30:32.843707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:32.968567Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:32.968567Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:5f3828e08276fc7882461769947e0bea216b891c1bb47a5f50d6b37fe54e51fd","observation_id":"a6b0e2ac-f3cc-458b-b5f1-7a05d1bccbac","resolution":{"observed_at":"2026-08-07T14:30:32.968567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T14:30:33.069465Z","title":"Cosyvoice 2: Scalable stream- ing speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.069465Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:e6954c954b018138b6ac5a8f7b19f406c11e3b63f5e3bf36c933950efa56f1e5","observation_id":"1287b22a-1773-48bc-9f46-c80ba15d3a0d","resolution":{"observed_at":"2026-08-07T14:30:33.069465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:34.540366Z","title":"Hello gpt-4o,","venue":null,"work_id":"86111f51-161f-43ba-8a2e-8d3ae3bea50b","year":2024},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.147124Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:3c694ae8b8082c865d440dcf50540ce3f7acb6008346ee887b4dbf84fed3d6fe","observation_id":"41aae15f-3d3b-484f-9192-aa32e66f3a62","resolution":{"observed_at":"2026-08-07T14:30:34.600778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:30:33.219850Z","title":"Train- ing verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.219850Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:dbcb1311b38bdc9b56a8356550e84701399e6d00782f762c9c4b89107ae22586","observation_id":"4768dfc9-f8be-469d-aa4a-351cb8402b54","resolution":{"observed_at":"2026-08-07T14:30:33.219850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T14:30:33.298274Z","title":"Measuring mathemat- ical problem solving with the math dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.298274Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:0397069fdb496d886737ef0099007fc3fca168cdfab1d7fd626b81ba8c3791d3","observation_id":"dc274852-8a96-486e-a07b-227f53a54fc5","resolution":{"observed_at":"2026-08-07T14:30:33.298274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:33.363830Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.363830Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:3bd50b89162eda184bfc3217df2ec5de846e88579a8416761837d5f20b847371","observation_id":"c638f1c8-ab81-459f-9d03-0ceda5bec962","resolution":{"observed_at":"2026-08-07T14:30:33.363830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.10190","last_updated":"2018-12-06T16:34:25Z","snapshot_observed_at":"2026-08-05T10:58:51.399386Z","submitted_at":"2018-05-25T15:04:17Z","title":"Snips Voice Platform: an embedded Spoken Language Understanding system for private-by-design voice interfaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.10190","snapshot_observed_at":"2026-08-07T14:30:33.466627Z","title":"Snips voice platform: an embedded spoken language under- standing system for private-by-design voice interfaces,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.466627Z"},"links":{"cited_paper":"/paper/1805.10190","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:1374b669ef097680f2b4343d16267abef9b1560fd483d53e154b2f7ef3de075d","observation_id":"77994d98-1949-4ee6-87e6-d9a144cdba15","resolution":{"observed_at":"2026-08-07T14:30:33.466627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03670","last_updated":"2019-07-25T17:56:23Z","snapshot_observed_at":"2026-07-06T07:44:28.011439Z","submitted_at":"2019-04-07T15:24:32Z","title":"Speech Model Pre-training for End-to-End Spoken Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03670","snapshot_observed_at":"2026-08-07T14:30:33.562288Z","title":"Speech model pre-training for end-to-end spoken language understanding,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.562288Z"},"links":{"cited_paper":"/paper/1904.03670","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:48e9562c977f49f17ac323d988b894fa797fe180181c0c1197d0cddaba43dd47","observation_id":"5cc71a69-6342-4500-8b2d-4106f84f54fa","resolution":{"observed_at":"2026-08-07T14:30:33.562288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:30:33.640309Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.640309Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:b7a12a51b68c8fbbfa012c3850990fe6436064e8f051a1ec11ab78393843e6ce","observation_id":"e30882b3-e03d-401d-80b8-addefa9bd630","resolution":{"observed_at":"2026-08-07T14:30:33.640309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:30:34.358196Z","title":"Covost 2 and massively multilingual speech translation","venue":null,"work_id":"c1ab4426-588a-4c0d-be5b-546e9cbc11a5","year":2021},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.717606Z"},"links":{"citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:d80a365998fc99fba9baebed1296aa0ba6254aa1243d0b5f9921e3f7f0a6a225","observation_id":"1cd6abe1-9626-40db-ad84-8e076c09b29c","resolution":{"observed_at":"2026-08-07T14:30:34.436593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:30:33.802965Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:33.802965Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.18644"},"observation_digest":"sha256:066c0729c725b8f90ca162ae0fb5753488ae12e9551410db621564bae1c7ad37","observation_id":"9ab42704-7e69-4852-a0a3-61943c0b3599","resolution":{"observed_at":"2026-08-07T14:30:33.802965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18644","last_updated":"2025-05-24T11:09:13Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T23:23:05.928955Z","submitted_at":"2025-05-24T11:09:13Z","title":"Enhancing Generalization of Speech Large Language Models with Multi-Task Behavior Imitation and Speech-Text Interleaving"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 3 inbound Pith citation observations for arXiv:2505.18644."}