{"as_of":"2026-08-09T15:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80e8586c98da97be8ac035d797489a7ff888f72b6e57d277dff4af7830efb3fd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":62,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:47:39.105733Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:29:41.322265Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-17T00:50:13.841689Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2410.17196"},"observation_digest":"sha256:99371f496b233c4e0e97bb33a448c8e45a1b1330364fb35ce3ffe963a1fa7982","observation_id":"8ddcf9c2-c033-4b24-87c2-3fbb7dc8e4a2","resolution":{"observed_at":"2026-05-17T00:50:13.971194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T03:53:47.396742Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.02612"},"observation_digest":"sha256:4a21143c5087eeca5210f7801baa8c66fb23ce2acf43e360262f799f2112d2ee","observation_id":"f6d2f7bb-0212-41b2-821f-8761c3a01feb","resolution":{"observed_at":"2026-05-16T03:53:47.496972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:018971b21943500564d24dfd2f7e45fbb74699645ae7dcf5a087a96696efe8b8","observation_id":"31b3f180-c57e-4f57-a86e-2b8d1f4efb8f","resolution":{"observed_at":"2026-05-17T21:08:19.661305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-08T22:47:39.105733Z","title":"Llama-omni: Seamless speech interaction with large language models.arXiv preprint arXiv:2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-09T08:33:21.749172Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.105733Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:d32c79f819de45d3db1818d70bb434681099481003540ad49eb88188f6fef019","observation_id":"7dc3286d-0748-4cc8-888e-601fe4d49c74","resolution":{"observed_at":"2026-08-08T22:47:39.105733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T22:05:23.804113Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09284","last_updated":"2025-05-30T17:30:40Z","snapshot_observed_at":"2026-08-07T21:59:45.229887Z","submitted_at":"2025-02-13T12:57:15Z","title":"SparQLe: Speech Queries to Text Translation Through LLMs","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T22:05:23.804113Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.09284"},"observation_digest":"sha256:f0c3daec966c58edb43586d8658d9f7cd5617e40a137722ab3b68280aa53ece3","observation_id":"b5002ec4-157b-4ce9-983b-9e285c585c7e","resolution":{"observed_at":"2026-08-07T22:05:23.804113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T20:02:51.322585Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-07T19:57:13.037270Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.322585Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:e930be0bf98da5fe9d8702f8497efd8bf64b6e77ad93c096031899165a43758b","observation_id":"d54a85f0-f0cb-403c-84be-bf3409720cca","resolution":{"observed_at":"2026-08-07T20:02:51.322585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:5b3653f831d9b8e6c3eb497d9f9d7594651d7f603dd50d01473173535b253f7c","observation_id":"2d3ae2fc-a0b0-4740-8024-10f7dbc5bf8e","resolution":{"observed_at":"2026-05-18T13:39:48.342720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:afc659157dce9372a2a69dc7d36941de50f25657805391bbad17d06a736433cf","observation_id":"033a91c0-6928-4fc0-91f1-3a1bdd811f0a","resolution":{"observed_at":"2026-05-11T19:21:27.234568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:39:33.966621Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14336","last_updated":"2025-05-21T14:22:18Z","snapshot_observed_at":"2026-08-09T14:12:04.052166Z","submitted_at":"2025-05-20T13:20:55Z","title":"Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:33.966621Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.14336"},"observation_digest":"sha256:d05a2a796b87c49de0f9887ad24563eaf6202bb906197afecd2c19670065fc4f","observation_id":"c07ba69b-84a4-4031-a186-ef95e4cb43fe","resolution":{"observed_at":"2026-08-07T15:39:33.966621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:38:36.938679Z","title":"arXiv preprint arXiv:2409.06666","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14438","last_updated":"2025-05-20T14:42:20Z","snapshot_observed_at":"2026-08-09T02:59:06.064910Z","submitted_at":"2025-05-20T14:42:20Z","title":"S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:36.938679Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.14438"},"observation_digest":"sha256:82ff6baf243a2c1672a81cce187cb0b2b0cb0c783403ed466cdafa9adaf01969","observation_id":"507fb53f-1c52-4fb5-81b3-7edc9f0ec53b","resolution":{"observed_at":"2026-08-07T15:38:36.938679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:35:34.644120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-07T15:30:47.759853Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.644120Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:84ba5d6f3ead14e6e87dd36c415f8e948efedb5aaf671150034b73d62d8a0083","observation_id":"180b0dc2-a501-411a-aaf2-b27ae8112244","resolution":{"observed_at":"2026-08-07T15:35:34.644120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:23:01.147173Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models // arXiv preprint arXiv:2409.06666","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.147173Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:e14f0cf46d11af4516229bce7ba8c1b6dfa9cb301ca79b643664a2ef1ed758e4","observation_id":"dc9e1a5e-b5fa-4f82-8711-d91ee80fa622","resolution":{"observed_at":"2026-08-07T15:23:01.147173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:51:16.069890Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17417","last_updated":"2025-05-23T03:05:47Z","snapshot_observed_at":"2026-08-08T14:59:41.765787Z","submitted_at":"2025-05-23T03:05:47Z","title":"Speechless: Speech Instruction Training Without Speech for Low Resource Languages","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:16.069890Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.17417"},"observation_digest":"sha256:beb9cb7624c6c4b845c7ae3adcb7c5749c1273310ae60da8e4aa55d5e1903ec0","observation_id":"0d13692c-21c8-42a9-bc12-cfe3f818b5c3","resolution":{"observed_at":"2026-08-07T14:51:16.069890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:19:55.644063Z","title":"Llama- omni: Seamless speech interaction with large language models.ArXiv, abs/2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.644063Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:52e2472c99d59a6866fca4539c46e9d8bf7c071fc9a8ad1f72129780edd9812a","observation_id":"9ca4f5b7-4a33-40d1-aa74-c22a6e2656c5","resolution":{"observed_at":"2026-08-07T14:19:55.644063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:16:33.562854Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19577","last_updated":"2025-06-30T16:21:25Z","snapshot_observed_at":"2026-08-09T07:23:25.547072Z","submitted_at":"2025-05-26T06:47:43Z","title":"MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.562854Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19577"},"observation_digest":"sha256:fff941d808065f12a38bee7e8ec10ef75c143468933a82b5d50cb27fff76bb37","observation_id":"a6c1b79e-1f1d-42bd-9d60-646fde200bf9","resolution":{"observed_at":"2026-08-07T14:16:33.562854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:15:55.598942Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.598942Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:9cbb761e9f238034d534cb83784e34801100678760f96e0f7eb9258aabe1bbbf","observation_id":"132089e7-bcf9-4ff1-ada2-857a733acffe","resolution":{"observed_at":"2026-08-07T14:15:55.598942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:01:30.307140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20277","last_updated":"2025-06-05T14:53:28Z","snapshot_observed_at":"2026-08-07T13:53:27.003686Z","submitted_at":"2025-05-26T17:55:06Z","title":"OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:30.307140Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.20277"},"observation_digest":"sha256:4a0c3c88855092294b31b57ba976b0aca3b0dad21f2ddfec6a4b015b3cd72469","observation_id":"d802cbdc-6ea6-4981-8b07-cc34f1544fc9","resolution":{"observed_at":"2026-08-07T14:01:30.307140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T13:09:24.344367Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-07T13:01:39.371778Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.344367Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:2ed77f596e5f9b6ea3d212635626dfe709a052d3e45770e1fe7b03d7bc270f58","observation_id":"d3b73640-6507-408d-a905-1fce1cd35252","resolution":{"observed_at":"2026-08-07T13:09:24.344367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T12:04:31.966356Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.966356Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:69d0391d99e8bda4af195346833c492caf8273d6d0f30fa4124282418e29c8ef","observation_id":"ce5592c6-903f-44ff-ae2d-861a45d3c6c1","resolution":{"observed_at":"2026-08-07T12:04:31.966356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:58:35.040733Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:35.040733Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:fd249f86170e9d8cf09920b4a6aaaf065e9990922737d95ca531586922dc26c8","observation_id":"9277ae40-93a8-402b-a2fb-6f5c118d4c39","resolution":{"observed_at":"2026-08-07T11:58:35.040733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:28:39.960930Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-07T21:53:15.843632Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.960930Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:0161cb728f340fad8281e1c5e36ed9f14e44606a94354e1cecfd80e619c24896","observation_id":"a38ced2f-e6bf-428d-9ab4-bc652ad434f4","resolution":{"observed_at":"2026-08-07T11:28:39.960930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:26:23.008363Z","title":"LLaMA-Omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02457","last_updated":"2025-06-03T05:21:51Z","snapshot_observed_at":"2026-08-08T20:25:15.377786Z","submitted_at":"2025-06-03T05:21:51Z","title":"SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:23.008363Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.02457"},"observation_digest":"sha256:8f44c552de1539268e7fcd57c8a0a31b8f0c841235b30c7dd086437cd39e1a4d","observation_id":"3a38c437-6768-4ac8-b6b1-defd92aa8332","resolution":{"observed_at":"2026-08-07T11:26:23.008363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:58:40.924179Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-09T06:02:47.435740Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.924179Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:c8f3d02497ca65181a90cb0bf7ff4a6cdac3701e350792cc9b2c34497210703e","observation_id":"076e0b54-13c8-48fa-aa92-1a3b5b45342a","resolution":{"observed_at":"2026-08-07T11:58:40.924179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T04:08:40.921978Z","title":"arXiv preprint arXiv:2409.06666 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11521","last_updated":"2025-06-13T07:22:36Z","snapshot_observed_at":"2026-08-07T12:06:46.005829Z","submitted_at":"2025-06-13T07:22:36Z","title":"Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:08:40.921978Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.11521"},"observation_digest":"sha256:c450c3b743933098b29d1743b27f7ad3e87d3eefb6861e9d6e704c5a57ee18e7","observation_id":"1985f09c-790f-448f-ba7c-612b0d17d029","resolution":{"observed_at":"2026-08-07T04:08:40.921978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T19:23:47.250006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05863","last_updated":"2025-07-08T10:44:27Z","snapshot_observed_at":"2026-08-09T13:22:58.114812Z","submitted_at":"2025-07-08T10:44:27Z","title":"KERAG_R: Knowledge-Enhanced Retrieval-Augmented Generation for Recommendation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:23:47.250006Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.05863"},"observation_digest":"sha256:3d58992a92f43ab756008b6d970935f476f82ddabdcc4157e25c57b2a33852ba","observation_id":"d734e001-cd5d-4eee-9cd4-638a837d3b22","resolution":{"observed_at":"2026-08-06T19:23:47.250006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T18:21:32.233590Z","title":"Llama-omni: Seamless speech interaction with large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08603","last_updated":"2025-07-11T13:55:45Z","snapshot_observed_at":"2026-08-09T04:59:19.398088Z","submitted_at":"2025-07-11T13:55:45Z","title":"Unlocking Speech Instruction Data Potential with Query Rewriting","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:21:32.233590Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.08603"},"observation_digest":"sha256:74da8dd7f8b5e4e002feaa83f00328a20580ef8a88bb8dfae793933444a6bb47","observation_id":"60989bf5-f0e4-4c5f-ae7d-85c95a1d3c30","resolution":{"observed_at":"2026-08-06T18:21:32.233590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T16:47:55.871612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-06T16:38:35.067803Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T16:47:55.871612Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.12705"},"observation_digest":"sha256:9960e0fbc5163fd87d5440fe0602ccf8d0f51c09cce85f7d164bd3a195dc5f35","observation_id":"c396d604-debf-4f00-846d-96cf0fba6658","resolution":{"observed_at":"2026-08-06T16:47:55.871612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T16:09:04.402999Z","title":"arXiv preprint arXiv:2409.06666 (2024) Title Suppressed Due to Excessive Length 15","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14412","last_updated":"2025-07-18T23:36:06Z","snapshot_observed_at":"2026-08-06T15:54:38.102710Z","submitted_at":"2025-07-18T23:36:06Z","title":"Personalized Socially Assistive Robots With End-to-End Speech-Language Models For Well-Being Support","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:09:04.402999Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.14412"},"observation_digest":"sha256:1037976fb7298f634eea011d737d1e333e5fc5a1a4ca618db44f8fca018a073f","observation_id":"f9ecc50f-fee8-4c79-bd65-941214304f01","resolution":{"observed_at":"2026-08-06T16:09:04.402999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:5306479e8b2a8cf8c176801b1fb10c373f533fa076a41ca1cb37b1cf588d8a71","observation_id":"cdb8ac00-ddad-47a7-abd9-6780ddf68f6e","resolution":{"observed_at":"2026-05-16T05:59:51.023035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T14:50:04.291383Z","title":"ArXiv abs/2409.06666 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.291383Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:1100c2b79da2f058b3a293b77484f342c104b39e0fa2ecb570f405fce94942ba","observation_id":"275754a4-9a8c-48fc-8896-d67dea81c1d9","resolution":{"observed_at":"2026-08-06T14:50:04.291383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T14:42:56.043822Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18181","last_updated":"2025-07-28T08:55:09Z","snapshot_observed_at":"2026-08-07T03:43:34.568661Z","submitted_at":"2025-07-24T08:27:53Z","title":"SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:56.043822Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.18181"},"observation_digest":"sha256:9972c4bd5a87c0f8198ff04a8361da7814af208b82993e7e1c170efec382edec","observation_id":"65f20b7f-5213-4063-be88-bbe4978d02b0","resolution":{"observed_at":"2026-08-06T14:42:56.043822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-05T21:45:23.907075Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08095","last_updated":"2025-08-11T15:33:44Z","snapshot_observed_at":"2026-08-07T16:13:39.029257Z","submitted_at":"2025-08-11T15:33:44Z","title":"Dual Information Speech Language Models for Emotional Conversations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:45:23.907075Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2508.08095"},"observation_digest":"sha256:769837001fc02ec95cd6860cf07131068b52c8323eaefe02d524fbdf40338f69","observation_id":"60e45a49-bb4c-47c9-8812-24061e498963","resolution":{"observed_at":"2026-08-05T21:45:23.907075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T00:12:39.834892Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:ce24b1c0e45c94c20140635affb99a8b54d01b627b927c6fd26c165085486ef8","observation_id":"ee928dbd-a44f-4c45-9c7c-8826b58e7890","resolution":{"observed_at":"2026-05-19T00:12:54.167660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T08:02:15.950975Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:ef277b4ac32c97091342ed84ea0daafcc06d2abb706491987c4bddca203cbb65","observation_id":"ddc7832d-be84-4b6a-a021-89c7de4e3344","resolution":{"observed_at":"2026-05-25T08:05:30.612129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-05T17:56:51.856505Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-08T09:52:34.305122Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:51.856505Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:2f34d523dfe9aea4d7b9bbbeaaa7445ec749aa29e2e756df96d9d92729cca073","observation_id":"ff509164-128d-453b-85bd-ae5fef3a68fa","resolution":{"observed_at":"2026-08-05T17:56:51.856505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-07T01:53:38.136292Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:8aa245531d050653f4443f591dcc47584cdf8ba66830e3f98febdf739944f713","observation_id":"ef60b9df-dd01-4cfb-a286-ad7713ca6c18","resolution":{"observed_at":"2026-05-21T22:24:23.513736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-04T23:33:04.355944Z","title":"Llama-omni: Seamless speech interaction with large language models.arXiv preprint arXiv:2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-06T19:22:29.209698Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.355944Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:6196d9a2839c3d294e1fba65b946a967ec5eebaa76ebd4cc51a1f89d83d0bf2d","observation_id":"91a0b4c1-b79f-45db-8bae-2e63819c3e44","resolution":{"observed_at":"2026-08-04T23:33:04.355944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-02T12:47:50.534468Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:0679ddd1a53ed7b9e6ac22a4003e9056694ad2928c8c91f109582506370a54a7","observation_id":"bca84238-c1e2-4017-a014-0ee3f5b7d255","resolution":{"observed_at":"2026-05-18T13:01:24.361876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-04T11:06:44.086529Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.086529Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:2c782034e649d9f4bde762bc9e830a93dfb1c5344baf903ca4652e2f00b16875","observation_id":"55ce28e0-4813-4353-8197-81b50a8f88de","resolution":{"observed_at":"2026-08-04T11:06:44.086529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2602.22710","last_updated":"2026-05-06T21:24:15Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T07:34:15Z","title":"Same Words, Different Judgments: How Preferences Vary Across Modalities","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T19:31:51.996480Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2602.22710"},"observation_digest":"sha256:b79ba1d5812ffc41d988154ea5b9aa15d140fb8ea9f33e82bc20885c8b94f6a0","observation_id":"73d20c5c-f39d-4b87-a946-54358ef0a2a3","resolution":{"observed_at":"2026-05-15T19:36:33.038978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-02T18:42:05.886184Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07025","last_updated":"2026-07-24T15:35:47Z","snapshot_observed_at":"2026-08-07T07:24:11.496264Z","submitted_at":"2026-03-07T04:09:47Z","title":"Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:42:05.886184Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2603.07025"},"observation_digest":"sha256:047cc1ad31991696b723f3e6d77d4c2d41c61f582226d84fda1a0f77e4dbab79","observation_id":"941f052b-a146-45b8-b2c5-7596fdacdd7f","resolution":{"observed_at":"2026-08-02T18:42:05.886184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-14T21:25:19.253843Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14275","last_updated":"2026-06-22T16:56:11Z","snapshot_observed_at":"2026-08-07T21:29:44.722085Z","submitted_at":"2026-03-15T08:17:25Z","title":"Controllable Accent Normalization via Discrete Diffusion","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T21:25:19.253843Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2603.14275"},"observation_digest":"sha256:27ecb2a1ce2e7acdc3a040ea630923f38488439c52aa189d31801317b9469c8a","observation_id":"8cf905bd-13d5-4852-88e2-5551808ab626","resolution":{"observed_at":"2026-07-14T21:25:19.253843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.03937","last_updated":"2026-05-05T16:27:33Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T16:27:33Z","title":"MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T15:34:50.848124Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.03937"},"observation_digest":"sha256:4e90899506f3ee1d255b930dc0541faa1eabfbeac10465839d46ea0b43fce2a3","observation_id":"18bc937b-afd2-45c0-be4a-79329bb0cbe7","resolution":{"observed_at":"2026-05-11T16:41:08.488015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.04700","last_updated":"2026-05-25T06:36:12Z","snapshot_observed_at":"2026-08-02T19:42:07.182660Z","submitted_at":"2026-05-06T09:52:29Z","title":"Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T18:08:16.051117Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.04700"},"observation_digest":"sha256:8fc05f0867134aa7fc33d1b34bfdbe968a8e789b8a16c10406deb75393f97a60","observation_id":"e57d5363-c6af-4b86-8681-b2d59a1be6c0","resolution":{"observed_at":"2026-05-09T06:45:44.079790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:3786440abfc324776fd59169525ad8a72d00ef622dbfb4fc7bbd09af07cf1786","observation_id":"be8c5c01-a85f-4883-87da-1846317b008e","resolution":{"observed_at":"2026-05-11T19:46:15.262510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:faa917bb475c99e5bd35977638c520d5773056b5cef08e9dcf1ac3a0d27b6699","observation_id":"7cb90703-4bc7-4fcc-9550-4a20e3920691","resolution":{"observed_at":"2026-05-11T00:50:49.611468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-08T18:16:48.532228Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:033dc9ae6a6daae1ce484b2f840e9434b15e989dbddda895cb565e732da09f4f","observation_id":"cf1b243e-3b0c-46ae-8eb7-1a1e3436288e","resolution":{"observed_at":"2026-05-11T04:50:55.866632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:591caef9175b07b2d9ea0fcf64c408228d7302fe0bc6878354e700019e65c68f","observation_id":"df2398ca-422d-4bb7-b0a5-6b4af5991141","resolution":{"observed_at":"2026-05-21T07:39:48.969176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T02:41:13.583493Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:41cb7c1ea905e0dd1e61c5c6daf7432952580f113c8574492cb6d99ae29bf92a","observation_id":"db74770c-bf98-4781-9492-e175e48af0a3","resolution":{"observed_at":"2026-05-21T02:43:55.027484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:87b1285c4e419f2d90c90ca36b45fe1bfdc9a430724ca370ae87d9df0aa5489b","observation_id":"4838ffaa-416f-4089-8ce4-244f17c814de","resolution":{"observed_at":"2026-06-30T17:34:57.361577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.21008","last_updated":"2026-05-20T10:44:56Z","snapshot_observed_at":"2026-07-06T23:31:32.577242Z","submitted_at":"2026-05-20T10:44:56Z","title":"A Survey of Audio Reasoning in Multimodal Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T02:08:06.976461Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.21008"},"observation_digest":"sha256:b8e3df4d0f2ffc55391f8f87b15065c7a5f90b634027ce262b0699a7f95b9f0c","observation_id":"a6d8c1b2-019d-468f-ad1a-814d5b2a6a22","resolution":{"observed_at":"2026-05-21T02:09:24.368254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:75b275069fa1bf35622ebdbdd5a00ea64abb0988906f2c64752af45e29a78d34","observation_id":"a43b7391-d3e0-4f63-9793-c00a05313c7a","resolution":{"observed_at":"2026-07-01T19:25:59.872963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.05121","last_updated":"2026-06-03T17:26:11Z","snapshot_observed_at":"2026-08-02T17:56:34.317060Z","submitted_at":"2026-06-03T17:26:11Z","title":"Audio Interaction Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:05.062465Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.05121"},"observation_digest":"sha256:179213c2cf4213d0acf7ba46182f08b44eaa90432016e95ef39cb40d004bfd48","observation_id":"65b49c1b-dac7-4476-b120-6205597d2b6d","resolution":{"observed_at":"2026-07-02T10:46:52.413130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:20e123d048298e43da8d12b2809fc48423ce13fd1df3aa23ca77bed6dfd54020","observation_id":"eb3d44dd-5b67-4797-96c8-e90f5dc44120","resolution":{"observed_at":"2026-07-02T17:27:15.662681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.11400","last_updated":"2026-06-09T19:44:46Z","snapshot_observed_at":"2026-08-09T08:22:06.812609Z","submitted_at":"2026-06-09T19:44:46Z","title":"Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T11:29:36.012349Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.11400"},"observation_digest":"sha256:faa59e5b86fe4969077de6cdbd1deb5060c2be120746c56cae70204ca3a13b8e","observation_id":"084cd552-38f0-4ee4-a5de-dac922514b7d","resolution":{"observed_at":"2026-07-03T07:57:44.819997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.12199","last_updated":"2026-06-10T15:19:15Z","snapshot_observed_at":"2026-08-07T21:59:04.835770Z","submitted_at":"2026-06-10T15:19:15Z","title":"Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T08:18:23.182355Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.12199"},"observation_digest":"sha256:c1b5dfd6ca52a4cc5db2a5db829ed2c2040d4713a8b8677a099d7f73ba3f9e08","observation_id":"a53e1ce9-d567-4f85-9ed0-d0ab6702f9c2","resolution":{"observed_at":"2026-07-03T13:18:12.825126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.21882","last_updated":"2026-06-20T04:47:45Z","snapshot_observed_at":"2026-08-08T03:12:18.006572Z","submitted_at":"2026-06-20T04:47:45Z","title":"Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T11:42:44.035902Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.21882"},"observation_digest":"sha256:a8f8c7f95ce9f435f3ad8f36ddb1d321cdd28070c67262e070e8f83ac8095c1f","observation_id":"6f7c5947-006b-4b80-9cfb-cf4596cd38eb","resolution":{"observed_at":"2026-07-04T08:29:41.323872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":215,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:506a2e557226eb52ca0097075133a331e29d732e8314a7cad3bce3abdcf13e3d","observation_id":"2ae65a48-4f96-4a77-8557-222645a0aa62","resolution":{"observed_at":"2026-07-01T11:55:42.281653Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"LLaMA-Omni : Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-06T10:59:50.296758Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:f328e08f2d38bb0c42e349cfe6dbc2a6cd7eaf5999eeab274c9570383f83c4eb","observation_id":"6199ec6f-8f95-4bcb-a4d8-b464e14d29db","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-07-11T22:58:26.763193Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:2b9e60f6f8de0a09daebd747360a5f3e30b11d3ec3a787d6fa3b1728b42557a8","observation_id":"a130e201-e309-4fdf-bb17-135aa45b6047","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-01T07:12:13.127289Z","title":"arXiv preprint arXiv:2409.06666 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-08T08:48:36.880078Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.127289Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:83944c4f97ffc6c4d36c0aa1978b85b8e59d59c5723789e327b0d50d54d696d7","observation_id":"788183f2-e31e-4971-a137-16cb22e0c543","resolution":{"observed_at":"2026-08-01T07:12:13.127289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-01T01:56:11.344932Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-09T07:53:49.457291Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:11.344932Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:d58f93ffc41e9f7ca55ed5ca1d8d96e602af7bf78c9c86459fefda4904d23fec","observation_id":"5e6763b9-2544-45e1-82ae-e2b4c8cbe348","resolution":{"observed_at":"2026-08-01T01:56:11.344932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.06666/citation-record","integrity":"/paper/2409.06666/integrity","json":"/paper/2409.06666/citation-record.json","paper":"/paper/2409.06666"},"outbound":[],"paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 62 inbound Pith citation observations for arXiv:2409.06666."}