{"as_of":"2026-08-04T11:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5600558b7af71018fe0ab42686da6fafb853ad700085aa94c0f0dac8ff5a6e43","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T23:55:11.698728Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T14:40:40.673091Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T03:47:35.741508Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"cited_work":{"arxiv_id":"2606.10231","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10231","snapshot_observed_at":"2026-07-03T03:47:35.741508Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","venue":"eess.AS","work_id":"5acdc8ac-c184-49c9-87d8-e5f4e530afee","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T14:40:40.673091Z"},"links":{"cited_paper":"/paper/2606.10231","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:298b7d9ae9e495b110518803194a129fd4a0565795ee9558d50d2c5e70269b33","observation_id":"43da8cc7-5865-4229-a5de-de8f154919cc","resolution":{"observed_at":"2026-07-03T03:47:35.742884Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10231/citation-record","integrity":"/paper/2606.10231/integrity","json":"/paper/2606.10231/citation-record.json","paper":"/paper/2606.10231"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.215684Z","title":"Prompting large language models with speech recognition abilities,","venue":null,"work_id":"3c32448c-2d37-440b-b856-0b779d376094","year":2024},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:188db76a51651e03fd5494218b6c92ae26442b43f03cf2e21e560e155e707b95","observation_id":"6c7dbc0f-113f-46a8-a039-5381085db54b","resolution":{"observed_at":"2026-07-04T23:30:12.217537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.235242Z","title":"Train short, infer long: Speech-llm enables zero-shot streamable joint asr and diarization on long audio,","venue":null,"work_id":"dca3eb0b-ae3b-400f-82eb-471a9487ce44","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:ed35bb00b24357657ad542fa558ed2d13aff775508e0120c062054526d7ab156","observation_id":"362812f5-2384-4cf9-a5a6-0cbfab55b69b","resolution":{"observed_at":"2026-07-04T23:30:12.236804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:6dc162c46ee29e1ce0f76c946e60e59bd55e0fb73dd58159bc981c7b3c776b39","observation_id":"f63f758d-1806-41b7-a231-a08cdb05976c","resolution":{"observed_at":"2026-07-03T23:59:06.133918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:58.307020Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":"357d9b97-de3b-485a-bd97-ec5f7d3a2070","year":2023},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:5ff8d3c0c4b46b91a6e7b38410949bf68c7127f42eab266e204371dab7e5fa4b","observation_id":"7f1e8f5b-0ac7-4b00-85b5-511704b01579","resolution":{"observed_at":"2026-07-04T23:30:12.228477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.265907Z","title":"Conformer: Convolution- augmented Transformer for speech recognition,","venue":null,"work_id":"4099d160-c70a-4d4b-a570-df9f66c6a64e","year":2020},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:6f485232164dc205e1f641c29fcbf59f0b1c90732044285fa0cb19fbf87ab4ab","observation_id":"16a6441f-d2ab-486e-9524-56a2493356c6","resolution":{"observed_at":"2026-07-04T23:30:12.267204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.239800Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":"64082757-d51b-4a7f-9f19-1e96202f3798","year":2022},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:f2e10d007d3c407f1bbba0ad94f66f64d47fa33f4d2d7f6c65947cd295ce8709","observation_id":"633d82b5-ff05-4003-b51c-45826bcee60a","resolution":{"observed_at":"2026-07-04T23:30:12.241210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.267834Z","title":"Fuyu-8B: A multimodal architecture for AI agents,","venue":null,"work_id":"c92278a7-d665-4fb9-9f31-9001deb38ad9","year":2023},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:2ed020c365fc9fa1cbbdee64f052fd0642cd0af45d5a727eafc6c7602898e8f1","observation_id":"0c773364-73a7-4419-8000-8f07df4dee5b","resolution":{"observed_at":"2026-07-04T23:30:12.269052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.222977Z","title":"Unveiling encoder-free vision- language models,","venue":null,"work_id":"64f1a0d7-db2b-4733-8e5e-e192e0d292ca","year":2024},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:0750e4282c22fff6691c7e5773174146506647ec091a1ffdb3275193a8718b42","observation_id":"f8c075f6-cd2f-4784-9eaa-be8e92ef0bb3","resolution":{"observed_at":"2026-07-04T23:30:12.224327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.269639Z","title":"Breaking the encoder barrier for seamless video-language understanding,","venue":null,"work_id":"5477c7c4-4a59-48d0-9b0f-e6609d5ed701","year":2025},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:990a71c9ecedec481619864cae88be6b0364b7314df904347094f83c2f28e4d6","observation_id":"3818f7cc-e2e1-40b3-a188-9ab78e46e9f9","resolution":{"observed_at":"2026-07-04T23:30:12.270914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.683068Z","title":"Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual Speech Recognition Evaluation","venue":null,"work_id":"a725e4ec-3331-4b0a-ae53-2084079eb773","year":2025},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:54fbc86ca0377a11eac3567a13ffb5302d96761b7e67e6b7a048bdc0a0afe708","observation_id":"d9042f0a-d363-4951-9f4d-4f4bee470f23","resolution":{"observed_at":"2026-07-03T23:59:06.149805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.231116Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"20093e32-c463-4741-8b5a-f051ec68cc3d","year":2023},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:a762ef814d308b349b7657e39dfe4840f3f2f61ee2c0c6add2ee93f0933e9079","observation_id":"8eb00970-682f-4c67-8983-b2666ff1d1bf","resolution":{"observed_at":"2026-07-04T23:30:12.232480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.220131Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":"d26ca22f-7107-4553-8526-219bca24f6f5","year":2024},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:dc6b3c98cb32d0b54924e0773e0074bd950e728b68b905af25c4fd5927f01ebb","observation_id":"23532edd-5bb7-444c-9652-a3a9a0ed5c70","resolution":{"observed_at":"2026-07-04T23:30:12.221450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2410.19168","doi":"10.48550/arxiv.2410.19168","metadata_source":"pith","pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","venue":"eess.AS","work_id":"e60f85db-636c-4830-af85-5d31ebc74a1b","year":2024},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:461ba4541159b7fff98f19007d00e87bb62e0a31eca9e5cabea5e083fcb1504c","observation_id":"31d2e2a3-768f-4f47-8752-d29ec784e632","resolution":{"observed_at":"2026-07-03T23:59:06.146529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.207551Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":"f74327e5-3db7-4d19-a749-69b7f16d81c1","year":2021},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:e8f055db7c8af80d7dac1327b181f08269a0b1864bffc1ae35ed2809c131f3ae","observation_id":"97abc9c8-d525-49fe-82e9-dddb473999ee","resolution":{"observed_at":"2026-07-04T23:30:12.208955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.241869Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"a534eb37-6c38-4061-82d7-5583ce97efde","year":2024},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:8eced6693117691befd774fa3a7cbd46756b8f02e0af0fe73ed00eaa14430181","observation_id":"8ec34912-5455-47e6-bf94-208642a8b258","resolution":{"observed_at":"2026-07-04T23:30:12.243113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.243707Z","title":"HuBERT: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"9326343d-4333-4d4f-a0ae-e1fe3848bf01","year":2021},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:daf4d2da867d29a27d443d74a61aa200fd3c938f19bc8ce3b837e27b5d0f1a93","observation_id":"c005f65f-b993-4f04-8b2f-d7d7e6c3a5c9","resolution":{"observed_at":"2026-07-04T23:30:12.245066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.263987Z","title":"SpeechGPT: Empowering large language models with intrinsic cross- modal conversational abilities,","venue":null,"work_id":"68ab8eba-9840-4702-9881-99718a07b9ca","year":2023},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:222aedcb570c1e1872ffd92526f7d930d7b9644ea2f470f28cb8974943d57a44","observation_id":"f0a27b5a-5033-4ea5-82e0-4a60a0f47b41","resolution":{"observed_at":"2026-07-04T23:30:12.265271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.250420Z","title":"V oxtLM: Unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks,","venue":null,"work_id":"481c34fc-614e-47c6-a835-2cb742ff1b58","year":2024},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:303310bce07edfec89bd97b0944230506fe0a86ea55d3d662b894a1a4d88512b","observation_id":"b98001c5-f2d2-40db-92fd-26808ecb7e7a","resolution":{"observed_at":"2026-07-04T23:30:12.251718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":"2402.05755","doi":"10.48550/arxiv.2402.05755","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Costa-jussà, Maha Elbayad, Sravya Popuri, Paul-Ambroise Duquenne, Robin Algayres, Ruslan Mavlyutov, Itai Gat, et al","venue":null,"work_id":"68de0d08-16b3-465c-8cd5-3ee2f70c1524","year":2024},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:35f72dbf6e6762a4af4d0795d7c3ebae01b9feca5e9102a848901ad0a5ea0603","observation_id":"5cc7e207-52eb-4a29-abee-57a4d35f7540","resolution":{"observed_at":"2026-07-03T23:59:06.152286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-07-06T18:50:13.559866Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":"2407.15835","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-07-03T23:59:06.138044Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":"b196131d-713c-44ae-bab4-4d52a3a93b48","year":2024},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:456ee4f6c780d45cfbda2fe4ae343abe78d2da702ef246128ffe55f410bd5052","observation_id":"65fc4da2-194f-4003-9faf-ee978db382d8","resolution":{"observed_at":"2026-07-03T23:59:06.142179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.260051Z","title":"Autoregressive speech synthesis without vector quantization,","venue":null,"work_id":"15004f24-4e62-417d-a961-3c975f024905","year":2025},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:cc1ecc04c2f27cc9e06d769e93996745b9a34bf6cb7aefc7cef19240056e1bfa","observation_id":"d32b1a49-e06f-4e4e-83fa-4eecf6a6ceb8","resolution":{"observed_at":"2026-07-04T23:30:12.261575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":"2508.19205","doi":"10.48550/arxiv.2508.19205","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Vibevoice technical report","venue":null,"work_id":"6d46a99d-ed41-4221-8fbe-35859ee85e2d","year":2025},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:98aae039de4058f096609b2306446018c6a6f6b03f8223d2c311ba62327d3475","observation_id":"d428e616-bdc4-4573-8fdd-3db1e99ad2d2","resolution":{"observed_at":"2026-07-03T23:59:06.137863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.254697Z","title":"HiFi-GAN: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"027918a1-bc31-4913-9c5e-13a27e39f324","year":2020},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:4939772d23b88323a8925eb0062d8c582ec7a445fa066385f147afdccc2ffe3a","observation_id":"602bb37a-9e30-4800-b9cb-b59167b4e5a2","resolution":{"observed_at":"2026-07-04T23:30:12.256283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.229257Z","title":"UTMOS: UTokyo-SaruLab system for V oiceMOS chal- lenge 2022","venue":null,"work_id":"3f0c9336-8260-48d2-8ac9-3c102e063d00","year":2022},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:a3bf06ffd9eabbd695135a9cda4d5ce9a3636de75bfed48f1b963f25108172a8","observation_id":"a62efd64-2a19-453b-a266-65cdb60508f8","resolution":{"observed_at":"2026-07-04T23:30:12.230564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.221226Z","title":"Simple and effective V AE training with calibrated decoders,","venue":null,"work_id":"1a4a4cdb-8d9b-447a-9d09-9da2cb335bad","year":2021},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:e7043df9fa410a2ee8b5ecd18e132092c5d962c2fddf1dff86b8ef7069f17959","observation_id":"22b2f636-672c-4097-996f-adc3d54d0ec1","resolution":{"observed_at":"2026-07-04T23:30:12.222434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2604.24763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.24763","snapshot_observed_at":"2026-07-10T13:37:06.881254Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"6d1815d2-46f1-4217-a874-f25ae24be85c","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2604.24763","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:7744f5def52c88121da9ef039290f1c9fe10bcb67ae1bd5d872fc9f81207accc","observation_id":"b55fc75b-67a4-49dd-a29b-6a47fc00ccde","resolution":{"observed_at":"2026-07-03T23:59:06.141726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31604","last_updated":"2026-07-03T09:50:38Z","snapshot_observed_at":"2026-08-03T15:39:37.184662Z","submitted_at":"2026-05-29T17:59:55Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","version":4},"cited_work":{"arxiv_id":"2605.31604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.31604","snapshot_observed_at":"2026-07-03T23:59:06.123206Z","title":"Representation Forcing for Bottleneck-Free Unified Multimodal Models","venue":"cs.CV","work_id":"77c93eb3-c0d0-4332-8fc3-941057695dde","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2605.31604","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:622f58a1d5a65787b9c0cb7604172dd53b579b4316fa55e4b3e83574f8b2dba5","observation_id":"921868c2-f87e-478e-92ee-4b377756fa90","resolution":{"observed_at":"2026-07-03T23:59:06.125682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"cited_work":{"arxiv_id":"2605.25343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25343","snapshot_observed_at":"2026-07-03T23:59:06.143525Z","title":"Toward Native Multimodal Modeling: A Roadmap","venue":"cs.CV","work_id":"08de0d4b-81be-45b4-b685-ab68036dd6dc","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2605.25343","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:7becfa5da3b1da7ccbeddb0d31facfb5e74870baf50583c298d67d9de9454181","observation_id":"364d29c4-d1b9-4b58-bcf5-2f1a3c2c3484","resolution":{"observed_at":"2026-07-03T23:59:06.145302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.255085Z","title":"MELA-TTS: Joint Transformer-diffusion model with rep- resentation alignment for speech synthesis,","venue":null,"work_id":"22f84116-58e3-4930-b065-86e201b303d7","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:37a279d6dad780abbddbf5e59804d90a638e59476bb10eb9259e6fc66bb30b0e","observation_id":"91525c26-1a95-48b6-beb4-eab7ef6532ee","resolution":{"observed_at":"2026-07-04T23:30:12.256872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29859","last_updated":"2026-05-28T12:39:36Z","snapshot_observed_at":"2026-08-01T16:23:26.516252Z","submitted_at":"2026-05-28T12:39:36Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","version":1},"cited_work":{"arxiv_id":"2605.29859","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.29859","snapshot_observed_at":"2026-07-03T23:59:06.127454Z","title":"MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables","venue":"eess.AS","work_id":"faafe19f-9d33-44b5-ab17-3579bf31935c","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2605.29859","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:a308bb2c722d693ba30037b3b9b2dc6a1f235a0fe8ac8da42bec66c9ecb15e6c","observation_id":"2f1c0eac-61fb-4a84-a34d-5fead643ddc3","resolution":{"observed_at":"2026-07-03T23:59:06.129686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"cited_work":{"arxiv_id":"2605.18749","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.18749","snapshot_observed_at":"2026-07-03T23:59:06.152150Z","title":"WavFlow: Audio Generation in Waveform Space","venue":"cs.SD","work_id":"2af0404a-fef6-425b-8bf4-6e6be7f10f19","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"cited_paper":"/paper/2605.18749","citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:33fc5ae10e75a451c0070c577122ff1622113011c3805dad18d1b100b3200e0d","observation_id":"316c97cf-0705-4025-bcf8-747a28f89ecb","resolution":{"observed_at":"2026-07-03T23:59:06.154351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.212070Z","title":"AlignFormer: Modality matching can achieve better zero-shot instruction-following speech-LLM,","venue":null,"work_id":"ee80c7ff-e48f-4c9a-9216-25c6f21c83a7","year":2025},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:33170292672a82ff02e5698b6cbc45c40915394a8076085d561afe0441325c4f","observation_id":"a640653e-73f3-4e2a-bf69-dea3768caee4","resolution":{"observed_at":"2026-07-04T23:30:12.213302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.231516Z","title":"Towards efficient speech-text jointly decoding within one speech language model,","venue":null,"work_id":"e343713e-98e2-4847-a338-621c1e9abbef","year":2025},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:2400ad9bef458673bf6baa9efc9c5c174b05dee767e76c51e47148bcf054e7ef","observation_id":"98f9e433-62b7-4192-bf1b-a7c0ab39a803","resolution":{"observed_at":"2026-07-04T23:30:12.232996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.262241Z","title":"SLM-S2ST: A multimodal language model for direct speech-to-speech translation,","venue":null,"work_id":"ab96af4d-882e-43e6-aeb0-bcf2993e9cd0","year":2025},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:69f71d621f7439ca4f9615011b2346b57f75da1bed59ed8745da38b12b91cfaa","observation_id":"00602b0c-7b9a-47de-9d87-d76afee85d89","resolution":{"observed_at":"2026-07-04T23:30:12.263409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2604.00610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:37:34.425227Z","title":"Speech llms are contextual reasoning transcribers,","venue":null,"work_id":"6269beb5-8ebb-4d60-8917-7a31187bfa7e","year":2026},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:bae17e9bcadd2dd384e57b5c6725f31fe0cb9bcaedf8de1cabb8b35d35cbe0f7","observation_id":"b6e83f15-8f58-41bb-9e0e-05f1e7b7d919","resolution":{"observed_at":"2026-07-03T23:59:06.115752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T00:33:08.850055Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"16bc9601-8de6-4e54-8d44-7110dc09fc42","year":2015},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:cfdbed740ec7cce586b05300dbf1b26fbca528d4cf243371b30a26ed40ea317f","observation_id":"2efeada1-7bb5-4578-ade6-d48da811fa11","resolution":{"observed_at":"2026-07-04T23:30:12.215139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.247836Z","title":"LibriSpeech-PC: Benchmark for evaluation of punctuation and capitalization capabilities of end-to-end ASR models,","venue":null,"work_id":"7763d248-6f6d-41e8-bacb-7e6e69d5e2b9","year":2023},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:a599ea3761ac26bbbe2316d00c81c484fdd3ec0af8f83c8ace7115bc6b6d351e","observation_id":"dc4becae-bb29-46aa-b2f7-214c095c8661","resolution":{"observed_at":"2026-07-04T23:30:12.249283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.252680Z","title":"GigaSpeech: An evolving, multi-domain ASR corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":"cd8b9389-3a60-4f17-84cf-0d61efb7806b","year":2021},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:fec6bfdf4ede3689d7ceb31884c4e3b6bf063f01c428737fc10d37eed94a64d1","observation_id":"ebb12562-5a16-4232-9ae2-f90c82db2f79","resolution":{"observed_at":"2026-07-04T23:30:12.254520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:06:10.117783Z","title":"MLS: A large-scale multilingual dataset for speech research,","venue":null,"work_id":"b9ab35e2-e5b1-4cb7-89df-4ab06f36a490","year":2020},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:7d6d1328734e1d729a9eaa07681262247a60f4a57a4fb1470ecb194a2f826224","observation_id":"4b1f62fd-d442-4c0f-b03a-7cea879f530f","resolution":{"observed_at":"2026-07-04T23:30:12.258819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.237382Z","title":"SPGISpeech: 5,000 hours of transcribed financial audio for fully formatted end-to-end speech recognition,","venue":null,"work_id":"7edba52a-979a-49d6-8f88-e4347d90a7f3","year":2021},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:1f2b9d5f52cbeba5565c88f8e4887140f99dc02cba93235939bd17c15b8711db","observation_id":"492e1106-ce4b-40c9-8369-edb966bdf933","resolution":{"observed_at":"2026-07-04T23:30:12.240287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.248141Z","title":"Common V oice: A massively- multilingual speech corpus,","venue":null,"work_id":"cf85c18d-7ca1-4958-9783-0946c4456290","year":2020},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:095e82478d0ee54a0e080c84b390dcef76853af81a05a27aba47c8536092fc94","observation_id":"7b1d7a7e-01ea-4736-ace2-a3e848b10ab1","resolution":{"observed_at":"2026-07-04T23:30:12.249767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.252473Z","title":"V oxPopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":"be845c38-2b63-46d7-a00c-72ed208c367b","year":2021},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:d88e13c8a79bc31c82c60cdac715ca3b9301b58f0b0c3cd8105954eb3c9892ee","observation_id":"89117a64-ea88-496d-a338-51ee90c19e8e","resolution":{"observed_at":"2026-07-04T23:30:12.253971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.236144Z","title":"TED-LIUM 3: Twice as much data and corpus repartition for experi- ments on speaker adaptation,","venue":null,"work_id":"5790f459-5873-4d3a-83af-bff31d6dd803","year":2018},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:e6fa16bb07299d6d9bf026f34f8fb2449ef649d3ddfe572571862895c9158992","observation_id":"9e52c3f9-da2d-479e-94b7-d7be15153519","resolution":{"observed_at":"2026-07-04T23:30:12.237577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.233627Z","title":"The AMI meeting corpus: A pre-announcement,","venue":null,"work_id":"b9d24ba3-c488-4be7-9e34-5baf772dc08b","year":2005},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:9f984a9be3a97d8f58cdda7f33052ce10e69db81d5e2769178a2cc6bdd7eb765","observation_id":"9e55fff3-ec64-45ce-b4f4-110865708704","resolution":{"observed_at":"2026-07-04T23:30:12.235426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.229129Z","title":"Earnings-22: A practical benchmark for accents in the wild,","venue":null,"work_id":"44b7e3c1-ad6a-433b-8eae-738855e06d90","year":2022},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:187de24701dc6da8024a76180856342e0cf6ff6f31e478dc55f47db95bfb81ab","observation_id":"7d77cbd8-b221-4498-b2f8-54e189b1d620","resolution":{"observed_at":"2026-07-04T23:30:12.230837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:30:12.218185Z","title":"FLEURS: Few-shot learning evaluation of universal representations of speech,","venue":null,"work_id":"1c9ca202-e35d-4b4d-9253-ed05a4c0b086","year":2023},"citing_paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-03T23:55:11.698728Z"},"links":{"citing_paper":"/paper/2606.10231"},"observation_digest":"sha256:40e4d8464564fdb12d49ad21e70de9cae875d159140a342149ce8c36855b601a","observation_id":"909e278b-f338-49a9-a4e4-df4c51425a3e","resolution":{"observed_at":"2026-07-04T23:30:12.219512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.10231","last_updated":"2026-07-02T05:30:19Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T23:49:27.565372Z","submitted_at":"2026-06-08T22:44:04Z","title":"LLM can Read Spectrogram: Encoder-free Speech-Language Modeling"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":34},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2606.10231."}