{"as_of":"2026-08-11T02:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f37469be53fc7256f28893f921ca002b7969a5ecfaa3db06f964c746edef6fa9","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T17:32:58.848455Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:13:57.633052Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T16:49:57.633553Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"cited_work":{"arxiv_id":"2605.20755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20755","snapshot_observed_at":"2026-07-04T16:49:57.633553Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","venue":"eess.AS","work_id":"7a690c3c-33b2-4fe8-a8aa-dc001cafdbfa","year":2026},"citing_paper":{"arxiv_id":"2606.05121","last_updated":"2026-06-03T17:26:11Z","snapshot_observed_at":"2026-08-02T17:56:34.317060Z","submitted_at":"2026-06-03T17:26:11Z","title":"Audio Interaction Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:05.062465Z"},"links":{"cited_paper":"/paper/2605.20755","citing_paper":"/paper/2606.05121"},"observation_digest":"sha256:5b5b5601afa424ea978c0493234faad5aec0ccc1da1c71b698f11033b8f7b87f","observation_id":"1107d89f-ae49-4579-be5d-e44915fae6c3","resolution":{"observed_at":"2026-07-02T10:46:52.391705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"cited_work":{"arxiv_id":"2605.20755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20755","snapshot_observed_at":"2026-07-04T16:49:57.633553Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","venue":"eess.AS","work_id":"7a690c3c-33b2-4fe8-a8aa-dc001cafdbfa","year":2026},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T00:13:38.523397Z"},"links":{"cited_paper":"/paper/2605.20755","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:f3d4a073090f9e5a08151d0a1a11de4e63cf401ecda41c6b34cbd6dd625abd97","observation_id":"020238b3-4dcd-474d-b0b9-c218d45259c4","resolution":{"observed_at":"2026-07-04T16:49:57.634773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"cited_work":{"arxiv_id":"2605.20755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20755","snapshot_observed_at":"2026-07-04T16:49:57.633553Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","venue":"eess.AS","work_id":"7a690c3c-33b2-4fe8-a8aa-dc001cafdbfa","year":2026},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-26T05:27:24.078053Z"},"links":{"cited_paper":"/paper/2605.20755","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:c21b4d25a1de51a0fcac7fe952c174edf653af2b3d3a40b5d477a6d0ff16ed9e","observation_id":"c1bd3ba1-4cf9-4664-ae10-c711551b2895","resolution":{"observed_at":"2026-07-04T13:09:50.915862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"cited_work":{"arxiv_id":"2605.20755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20755","snapshot_observed_at":"2026-07-04T16:49:57.633553Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","venue":"eess.AS","work_id":"7a690c3c-33b2-4fe8-a8aa-dc001cafdbfa","year":2026},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T09:43:09.347118Z"},"links":{"cited_paper":"/paper/2605.20755","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:17632ed31cbd613630d3464ffd9b00397a36402892ab043742ce738bed001282","observation_id":"b7f1b8cd-a8a2-431f-af3a-160430d3f501","resolution":{"observed_at":"2026-06-30T09:44:37.357107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20755","snapshot_observed_at":"2026-08-03T10:13:57.633052Z","title":"arXiv preprint arXiv:2605.20755 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.633052Z"},"links":{"cited_paper":"/paper/2605.20755","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:6f29d826cb9233db06f070fbe7c3b7710c89dfbcee60031cf58433215e511c34","observation_id":"e5a96d3b-4301-4639-8848-e9d03eedb21f","resolution":{"observed_at":"2026-08-03T10:13:57.633052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.20755/citation-record","integrity":"/paper/2605.20755/integrity","json":"/paper/2605.20755/citation-record.json","paper":"/paper/2605.20755"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.19487","last_updated":"2024-10-29T17:44:03Z","snapshot_observed_at":"2026-07-06T18:22:18.644161Z","submitted_at":"2024-05-29T20:05:46Z","title":"A Full-duplex Speech Dialogue Scheme Based On Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.19487","doi":"10.48550/arxiv.2405.19487","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19487","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A full-duplex speech dialogue scheme based on large language model","venue":"arXiv (Cornell University)","work_id":"ad2d6e58-10ce-411e-8c42-69599642b323","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2405.19487","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:74e374f1d00955058ee3fe750e4373a561cbb71ab28be8d2b4f8b352de253747","observation_id":"e9835947-2422-4c8e-b1ac-35d4d080d17c","resolution":{"observed_at":"2026-06-30T17:34:57.341245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15594","last_updated":"2024-09-23T23:01:31Z","snapshot_observed_at":"2026-07-06T19:20:51.266758Z","submitted_at":"2024-09-23T23:01:31Z","title":"Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents","version":1},"cited_work":{"arxiv_id":"2409.15594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15594","snapshot_observed_at":"2026-06-30T17:34:57.336915Z","title":"N., Yu, B., Gong, H., and Gol- lakota, S","venue":null,"work_id":"f0e0b216-7bab-4427-8772-40247031fcf3","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2409.15594","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:43c5534cc6d8b0b4ff1792b2071bd91699b767971e8461835c945185743f6884","observation_id":"15b4544e-2b43-4746-92dc-048b86451097","resolution":{"observed_at":"2026-06-30T17:34:57.338471Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:078546a8875afd03509e0f2f1938d1bd0147df104f7d84cb97a5d226ec981ff2","observation_id":"023cbe8c-e963-4b83-9c82-cdeddd7a5d96","resolution":{"observed_at":"2026-06-30T17:34:57.332842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-10T19:46:14.169100Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:fd608a8993732a6e74bd6013a68902fdf62674d7119d0239aa3fae6915d3bb34","observation_id":"9ba951a5-3065-44ce-8f9f-83ddbaf3159d","resolution":{"observed_at":"2026-06-30T17:34:57.380968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-08-09T02:58:40.541098Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2411.18138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-07-04T03:49:30.373862Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understanding and generation","venue":null,"work_id":"28fdac16-3d7f-4580-bfab-d6509003e772","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:b1b898e74363da4da91e0b7baaa1779ad31a832ab0c9b8db6e949c7727cad2bb","observation_id":"1aeb9e24-244b-4c88-8f5b-f3488cb8ca2c","resolution":{"observed_at":"2026-06-30T17:34:57.330308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2025-874","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient and direct duplex 14 DuplexSLA modeling for speech-to-speech language model","venue":null,"work_id":"093dca9c-afaf-438e-b6c9-3d8f3a6dfdd7","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:2cd26e7e093d73056506c225f41e1f7c706ca362c9f641ad1242fa5e65ce03c0","observation_id":"5faf939b-3d24-411d-a178-06f698bc79e6","resolution":{"observed_at":"2026-06-30T17:34:56.831466Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:54.030333+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:54.030333+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:49:25.023354Z","title":"Covo-audio technical report","venue":null,"work_id":"b131a09f-08ea-46fa-8553-8ea5fc48c89c","year":2026},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:062fa3f6a3a1f34d19709e174249d8ebbfd6302f1db37093c693167f381fd2dd","observation_id":"d56001ab-b8aa-44cc-8d51-70a2ce30bc94","resolution":{"observed_at":"2026-06-30T17:34:57.352574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06053","doi":"10.48550/arxiv.2602.06053","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Personaplex: V oice and role control for full duplex conversational speech models","venue":"Open MIND","work_id":"f9ff1418-0d52-48ae-b0a2-8de74df0fcfb","year":2026},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:60b64a2e2fe95e12e70c213b16e7c05ef54b9d4e6f360102bf0de3413ad3b842","observation_id":"545c6986-d639-4474-a94d-3155d96c129d","resolution":{"observed_at":"2026-06-30T17:34:57.358844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":"2408.16725","doi":"10.48550/arxiv.2408.16725","metadata_source":"pith","pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":"cs.AI","work_id":"5192d640-6f69-48bb-b5e7-c2eb57e52726","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:4e1f93f9cc9015270611fe7ca59092b923ae35d0d50b701267d1f8a1a1fe465f","observation_id":"55316a08-8ff2-4fd0-8a67-f2941ebc47ac","resolution":{"observed_at":"2026-06-30T17:34:57.357997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":"2410.11190","doi":"10.48550/arxiv.2410.11190","metadata_source":"pith","pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-omni2: Towards open-source gpt-4o with vision, speech and duplex capabilities","venue":"eess.AS","work_id":"104f05e3-a490-4b69-90dc-68a70e9c5355","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:ee28f70ecd91fee1b0ff7dfd1fb0c4e6375d0580490ac0b7fa96497cb99ace7a","observation_id":"22db588d-7ad2-4e26-87bb-d8e950105eda","resolution":{"observed_at":"2026-06-30T17:34:57.307538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.862459+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.862459+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:9469c66e997f44b82d64fba9e1d86c35118de7aa1a85fe87ca8cc0b019073f7e","observation_id":"4838ffaa-416f-4089-8ce4-244f17c814de","resolution":{"observed_at":"2026-06-30T17:34:57.361577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:fb3d8fd1de62e487ff7c80dac689c5fc951809bfd3f5a2545c8bd03a7016143d","observation_id":"cf4b8bca-23fe-4d39-bbd1-7b9578862be6","resolution":{"observed_at":"2026-06-30T17:34:57.341812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-08-10T22:55:26.169228Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":"2402.05755","doi":"10.48550/arxiv.2402.05755","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Costa-jussà, Maha Elbayad, Sravya Popuri, Paul-Ambroise Duquenne, Robin Algayres, Ruslan Mavlyutov, Itai Gat, et al","venue":"arXiv (Cornell University)","work_id":"68de0d08-16b3-465c-8cd5-3ee2f70c1524","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:b77d17847978c4bb13f6bcd5e4b87c641941b6ce3bcd8d039009ab7141ab3d01","observation_id":"4c621460-4a03-419b-8118-66c9c62afaf3","resolution":{"observed_at":"2026-06-30T17:34:57.346754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02707","last_updated":"2025-05-05T15:05:01Z","snapshot_observed_at":"2026-08-07T15:56:20.774999Z","submitted_at":"2025-05-05T15:05:01Z","title":"Voila: Voice-Language Foundation Models for Real-Time Autonomous Interaction and Voice Role-Play","version":1},"cited_work":{"arxiv_id":"2505.02707","doi":"10.48550/arxiv.2505.02707","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02707","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oila: V oice-language foundation models for real-time autonomous interaction and voice role-play","venue":"ArXiv.org","work_id":"049a1fe0-cd6f-43c7-a6c7-d168231a4d21","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2505.02707","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:5feee794b2d231340b911ecd0af4f6bfe25dbb8bf89ba2db3ac00435fe6a029e","observation_id":"57dc6c13-b400-45cb-822b-464e6734da8d","resolution":{"observed_at":"2026-06-30T17:34:57.349819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T15:37:06.838629Z","title":"Chronological thinking in full-duplex spoken dialogue language models","venue":null,"work_id":"4c63fc14-bec8-4822-b330-9def61feaae9","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:ac75c8881f85d20975787ab9ef67f66c8ae5e50da262d3b0dfab0bfcecf00399","observation_id":"3aee9618-5a94-4ebe-b7de-959b4f1fa015","resolution":{"observed_at":"2026-06-30T17:34:57.344308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09592","last_updated":"2026-05-10T15:21:35Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:50:59Z","title":"Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models","version":2},"cited_work":{"arxiv_id":"2510.09592","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.09592","snapshot_observed_at":"2026-07-03T17:18:44.087054Z","title":"Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models","venue":"cs.CL","work_id":"15e53184-58e7-4867-8d1f-5e833acbd01e","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2510.09592","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:8ee6c64c9246ca2b13c8f218a7c5c92d0cb3c94d4442545a1b425c2da8a72ee6","observation_id":"8df56ad0-10a2-47d9-b38b-ac13e967fda8","resolution":{"observed_at":"2026-06-30T17:34:57.336753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:3c105ecdc7e788659f74cfdac5d945447cc9ec68753fa479f9b58e313998fd42","observation_id":"05fc70c6-7f92-4365-b72b-255ff4dffc37","resolution":{"observed_at":"2026-06-30T17:34:57.329158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:55516c1b1d40150e60eee0d87ac8b4f24a06e5607efbd799550ebc2d77789d90","observation_id":"37c4dd72-d28a-40ad-9a4f-d3fb258f652b","resolution":{"observed_at":"2026-06-30T17:34:57.324473Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:742366fc65efaac0e0026cd4b77546948835ae235cdf5428cd7a017c7e5d7cba","observation_id":"b8d0dbc3-3147-49a9-84a8-58631c65090c","resolution":{"observed_at":"2026-06-30T17:34:57.326987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2507.16632","doi":"10.48550/arxiv.2507.16632","metadata_source":"pith","pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Audio 2 Technical Report","venue":"cs.CL","work_id":"2317bc9f-2d58-4e53-b7ea-804337e9fdef","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:fadef4ea870d0f099a4ffaa6ab2f5181340a7d1b2811c2058b42dd4a41aec60d","observation_id":"0ca85e37-9c8e-4e52-9c37-61d74f64ebdd","resolution":{"observed_at":"2026-06-30T17:34:57.386787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15848","doi":"10.48550/arxiv.2511.15848","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-audio-r1 technical report","venue":"arXiv (Cornell University)","work_id":"80b24600-9960-4df9-97b2-66714cfd73f5","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:39956ae5f3bfaa12f6ee6c141ad37b9305fe8464c462e5bdc2d31b52156ba825","observation_id":"5c040669-e168-40ea-a788-d5918f790e6d","resolution":{"observed_at":"2026-06-30T17:34:57.352865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25719","last_updated":"2026-05-31T23:35:54Z","snapshot_observed_at":"2026-08-03T00:45:36.849248Z","submitted_at":"2026-04-28T14:44:30Z","title":"Step-Audio-R1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2604.25719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.25719","snapshot_observed_at":"2026-06-30T17:34:57.320451Z","title":"Step-Audio-R1.5 Technical Report","venue":"eess.AS","work_id":"74d860ea-f21d-4baf-8642-60fa524014ca","year":2026},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2604.25719","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:a0f62d25a066c84e51744448333333773da95356ad21cab25e63d06f262fef07","observation_id":"c3fd87af-b37b-4061-a6db-076145f801fe","resolution":{"observed_at":"2026-06-30T17:34:57.321667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:1cc15f15b29e72336f2b48b401650819ca19a3c4e894fc9581a8cee3d8f95ff7","observation_id":"74e72d1d-808c-4c53-b168-6bf51ef6c5f6","resolution":{"observed_at":"2026-06-30T17:34:57.309897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:89485b22e6fb82a2bdc21e7bfc877a748730c0aeb6ea8719429b67bf41383abf","observation_id":"461db628-4cb9-4179-b028-40472f2286c7","resolution":{"observed_at":"2026-06-30T17:34:57.292528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":"2412.02612","doi":"10.48550/arxiv.2412.02612","metadata_source":"pith","pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","venue":"cs.CL","work_id":"1d250ff4-6ca5-4eb5-b561-48106b630d8b","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:230ef41c707527fb56f7f5e3b98c61357c9a7867356eb8502e187cd0a29016f0","observation_id":"85596773-8041-411c-8de9-8380400cefa5","resolution":{"observed_at":"2026-06-30T17:34:57.375297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":"2501.01957","doi":"10.48550/arxiv.2501.01957","metadata_source":"pith","pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","venue":"cs.CV","work_id":"510354f3-222a-48da-bda9-96a2df30bb68","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:4541e0d247bfa0d3220df310b3b1f633417b56c8fa34938e63f9892984aaa23e","observation_id":"708f9c9f-fc47-4a3a-b3c8-8d5fd6be44d7","resolution":{"observed_at":"2026-06-30T17:34:57.369814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.03739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T13:05:45.811020Z","title":"Vita-audio: Fast interleaved cross-modal to- ken generation for efficient large speech-language model","venue":null,"work_id":"b95ed2e2-a122-49ab-901b-4f06fc3ae0c0","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:1706675e9557df182a168be9a3960faa1a87a2f1b45d401efa848ecc5d4be2c0","observation_id":"c011e9e1-acae-470e-9b73-c73577fff584","resolution":{"observed_at":"2026-06-30T17:34:57.298264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:49.619033Z","title":"Minicpm-o 2.6: A gemini 2.5 flash level mllm for vision, speech, and full-duplex multimodal live streaming on your phone","venue":null,"work_id":"331d3769-c768-4e09-829b-e08703bda560","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:2243ebea0a48c8eab68885e52bd71af94c99ad3f2e2cd8cdbf1aed02c30893ba","observation_id":"4cea8c54-3247-4bd1-8e25-a6dcb9565d86","resolution":{"observed_at":"2026-07-08T08:54:49.620945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:49.616170Z","title":"Mamba in speech: Towards an alternative to self-attention.IEEE Transactions on Audio, Speech and Language Processing","venue":null,"work_id":"e27c8320-3484-4724-b0c5-beb133f6abae","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:a9c50751ff34f373eb161be1d3e43b0e938973ed3b65cd232dac7fa25d8859d8","observation_id":"00731764-30ef-4d71-9af2-8a743e17e4b5","resolution":{"observed_at":"2026-07-08T08:54:49.618089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:49.621937Z","title":"Code-switching speech recognition under the lens: Model-and data-centric perspectives.IEEE Transactions on Audio, Speech and Language Processing","venue":null,"work_id":"fa7055d6-3e6d-41b7-b87a-09fbf01825de","year":2026},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:150bfe01578f4cfe7952b415f62a8917f063e8009a463f7865d3a36900097f86","observation_id":"c714de8a-37f2-4928-b7fb-a53f225d7270","resolution":{"observed_at":"2026-07-08T08:54:49.623697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"cited_work":{"arxiv_id":"2605.12034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12034","snapshot_observed_at":"2026-06-30T17:34:57.376694Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","venue":"cs.MM","work_id":"3d44bbf2-61a6-4226-b3f4-c18dfb8f1aac","year":2026},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2605.12034","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:97a5046cd9269a1e74fb238d209294a81795ea73ba46bc8038b61e58cfa1e51e","observation_id":"6206bdeb-4f09-47b2-8699-d386e2731871","resolution":{"observed_at":"2026-06-30T17:34:57.378101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-09T21:30:12.152751Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:8801b241d5889e7608a9ae15c5f626fa3f9d6941f7aadc6ec2944306ce356830","observation_id":"34394e45-5b0c-431d-baca-212bcd26ae95","resolution":{"observed_at":"2026-06-30T17:34:57.367281Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21875","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.749214Z","title":"Wildspeech-bench: Benchmarking end-to-end speechllms in the wild","venue":null,"work_id":"0d282d54-dce1-40c1-acbd-984e209ce677","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:710b58c2cd47bb8815a01a53bc11e7f60fc5abcbe90241d43bcf0fcb63f7a2f9","observation_id":"cdf6a87b-8d9e-45d1-9503-e0403f078583","resolution":{"observed_at":"2026-06-30T17:34:57.331772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-02T22:58:18.776196Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":"2506.04779","doi":"10.48550/arxiv.2506.04779","metadata_source":"pith","pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","venue":"cs.CL","work_id":"1a24d3b1-2d00-407c-90f0-b0aeec13bfe6","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:40b7d5ce026c1189bc94be614db1978b8b8c4c4b01e5b03b94313c86317f5d2d","observation_id":"0d3ffd4d-214c-4e3f-b28b-b42b3dcfec6f","resolution":{"observed_at":"2026-06-30T17:34:57.372663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T09:22:14.816429+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2410.19168","doi":"10.48550/arxiv.2410.19168","metadata_source":"pith","pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","venue":"eess.AS","work_id":"e60f85db-636c-4830-af85-5d31ebc74a1b","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:ad2f8acfdbb0d454512759e5c9482c5e7e515b334a3ced23c8c7ac4e53055864","observation_id":"7e80d426-1ee9-422c-b4d8-0e66d83a7bc0","resolution":{"observed_at":"2026-06-30T17:34:57.295224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T17:34:57.362731Z","title":"Multi-bench: A multi-turn interactive benchmark for assessing emotional intelligence ability of spoken dialogue models","venue":null,"work_id":"67e3348d-1a9b-4869-bcf0-a69f0d6c72e1","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:92d2fd04dac1d40731b96c9c68559f427e9de2c74d3efdda860e8d618c13b34c","observation_id":"cebd606e-9085-4271-b8a9-81102bd57033","resolution":{"observed_at":"2026-06-30T17:34:57.364368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01174","last_updated":"2025-03-03T04:46:04Z","snapshot_observed_at":"2026-08-07T17:34:52.724764Z","submitted_at":"2025-03-03T04:46:04Z","title":"Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics","version":1},"cited_work":{"arxiv_id":"2503.01174","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.01174","snapshot_observed_at":"2026-07-07T14:53:55.794102Z","title":"Talking turns: Benchmarking audio foundation models on turn-taking dynamics","venue":"cs.CL","work_id":"ceeb072e-0415-4508-999c-bcb728f2e57a","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2503.01174","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:5bdee95a9b5d1d51890d23f973a06f77d00784a844bb77d2536c0e58c82f763f","observation_id":"44d56285-f5f5-4bc4-b632-72ac5a7c9ad5","resolution":{"observed_at":"2026-06-30T17:34:57.383937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":"2410.17196","doi":"10.48550/arxiv.2410.17196","metadata_source":"pith","pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","venue":"cs.CL","work_id":"2e4e260a-a952-42ae-9dd6-2de2d3127881","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:b2fa32c5a7a9feee9aef8c86f322dd7e115a50f4b823dd55333007fb274413cc","observation_id":"432c3dd3-0ba3-4c31-b0da-e50fb7711d3c","resolution":{"observed_at":"2026-06-30T17:34:57.312480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07729","last_updated":"2024-07-26T06:30:47Z","snapshot_observed_at":"2026-08-06T03:59:19.956442Z","submitted_at":"2024-02-12T15:41:22Z","title":"AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension","version":2},"cited_work":{"arxiv_id":"2402.07729","doi":"10.48550/arxiv.2402.07729","metadata_source":"pith","pith_arxiv_id":"2402.07729","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Air-bench: Benchmarking large audio-language models via generative comprehension","venue":"eess.AS","work_id":"d370d7c7-6672-4149-b423-fd65d5cc3cd1","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2402.07729","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:fca2e1fcdd82bc854871934b461d9e5d6dd7c2e109fffac7d421c990c3b34abb","observation_id":"54f92202-0963-446c-b3c9-10a8abe0ae5d","resolution":{"observed_at":"2026-06-30T17:34:57.327536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13340","last_updated":"2025-01-16T08:34:36Z","snapshot_observed_at":"2026-08-06T08:45:30.995210Z","submitted_at":"2024-06-19T08:46:29Z","title":"SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words","version":2},"cited_work":{"arxiv_id":"2406.13340","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.13340","snapshot_observed_at":"2026-06-30T17:34:57.316727Z","title":"Sd-eval: A benchmark dataset for spoken dialogue understand- ing beyond words","venue":null,"work_id":"b940e4f9-e207-4893-abec-6f74c81f5c8b","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2406.13340","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:a013b8ccc69295cb5974371711bdc27c27fb8b9e64f5ce73b8cc97920baaa25d","observation_id":"2ee8075f-3901-4ce0-9480-6a7e7e40ba33","resolution":{"observed_at":"2026-06-30T17:34:57.318295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17810","last_updated":"2025-08-10T12:34:42Z","snapshot_observed_at":"2026-08-07T17:51:23.956942Z","submitted_at":"2025-02-25T03:31:48Z","title":"URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models","version":3},"cited_work":{"arxiv_id":"2502.17810","doi":"10.48550/arxiv.2502.17810","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17810","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chih-Kai Yang, Yu-Kuan Fu, Chen-An Li, Yi-Cheng Lin, Yu-Xiang Lin, Wei-Chih Chen, Ho Lam Chung, Chun-Yi Kuan, Wei-Ping Huang, Ke-Han Lu, and 1 others","venue":"ArXiv.org","work_id":"84beecc1-d27b-42f6-bb23-0db5fb15a00d","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2502.17810","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:b32019d7e236e4e8d517101d847136655381f507093ed6087b734511f30c7b79","observation_id":"d981c1f0-b2bf-43c5-9c63-56797b1abc01","resolution":{"observed_at":"2026-06-30T17:34:57.301296Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.15727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:00:05.337825Z","title":"Vocalbench: Benchmarking the vocal conversational abilities for speech interaction models","venue":null,"work_id":"c3125692-20ab-4e87-8b2e-9b5ae17a15c1","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:9bf9f6761281542fdc1273ef2deaefa333d36b1e8dde39c5b153c8bb6c82fa16","observation_id":"ca4b479f-2bd3-40ed-b410-323475f59dfc","resolution":{"observed_at":"2026-06-30T17:34:57.343785Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":34,"verified_fuzzy":3},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 5 inbound Pith citation observations for arXiv:2605.20755."}