{"as_of":"2026-08-20T18:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3aa7958a1a8804eb106375afb4f80f881e146f783eaf0981c8d639df727cfa4","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:49:58.269093Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:34:50.786808Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:28:39.133843Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":"2505.17060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-07-03T16:28:39.133843Z","title":"Salmonn-omni: A standalone speech llm without codec injection for full- duplex conversation.arXiv preprint arXiv:2505.17060","venue":null,"work_id":"5b053464-9fd0-4025-a38f-5c6ae551187c","year":2025},"citing_paper":{"arxiv_id":"2509.26388","last_updated":"2026-05-01T17:28:37Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T15:23:39Z","title":"Game-Time: Evaluating Temporal Dynamics in Spoken Language Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T11:51:43.561210Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2509.26388"},"observation_digest":"sha256:bec1a5c67bbc70bcb933005cf914be992750d10bc0992d506f7e97b32c09337c","observation_id":"08b72cb5-3750-498e-8192-f7b162fd8fd1","resolution":{"observed_at":"2026-05-18T11:52:35.704744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":"2505.17060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-07-03T16:28:39.133843Z","title":"Salmonn-omni: A standalone speech llm without codec injection for full- duplex conversation.arXiv preprint arXiv:2505.17060","venue":null,"work_id":"5b053464-9fd0-4025-a38f-5c6ae551187c","year":2025},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-15T02:56:04.141573Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T08:34:56.898815Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:16cd9db5480ded85a9ada98019d7ec080adc73d253ddbb5d52ae72fc030a26c7","observation_id":"88a0d817-2b58-4e84-83b2-ca92c957c846","resolution":{"observed_at":"2026-05-15T08:35:18.379168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":"2505.17060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-07-03T16:28:39.133843Z","title":"Salmonn-omni: A standalone speech llm without codec injection for full- duplex conversation.arXiv preprint arXiv:2505.17060","venue":null,"work_id":"5b053464-9fd0-4025-a38f-5c6ae551187c","year":2025},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-15T02:56:04.141573Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T10:43:27.176535Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:75ff9b7b84cb0c624d39fc0bde23282ba744105b8ae5a29896103e2dd939823f","observation_id":"ea35f16f-6991-485c-8ad9-2ad830756197","resolution":{"observed_at":"2026-05-21T10:44:07.707055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-07-13T22:57:11.059962Z","title":"SALMONN- omni: A Standalone Speech LLM without Codec In- jection for Full-duplex Conversation.arXiv preprint arXiv:2505.17060,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-15T02:56:04.141573Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T22:57:11.059962Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:43dd3e6ba60b30b3612eaeba86f4843fa5214f733aef1ce839b737d494485060","observation_id":"4d459a23-9ee9-43c1-aa4c-a75a110836bf","resolution":{"observed_at":"2026-07-13T22:57:11.059962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":"2505.17060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-07-03T16:28:39.133843Z","title":"Salmonn-omni: A standalone speech llm without codec injection for full- duplex conversation.arXiv preprint arXiv:2505.17060","venue":null,"work_id":"5b053464-9fd0-4025-a38f-5c6ae551187c","year":2025},"citing_paper":{"arxiv_id":"2605.10199","last_updated":"2026-05-11T08:46:47Z","snapshot_observed_at":"2026-08-16T03:05:03.130591Z","submitted_at":"2026-05-11T08:46:47Z","title":"How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T03:08:55.753359Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2605.10199"},"observation_digest":"sha256:b49c1df37a746dd2f305696a100bd462b16ecfac5147266f4b08e3253310b9b4","observation_id":"2360c1d3-009a-48a7-ac00-1e304b47a8ec","resolution":{"observed_at":"2026-05-12T03:11:19.100069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":"2505.17060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-07-03T16:28:39.133843Z","title":"Salmonn-omni: A standalone speech llm without codec injection for full- duplex conversation.arXiv preprint arXiv:2505.17060","venue":null,"work_id":"5b053464-9fd0-4025-a38f-5c6ae551187c","year":2025},"citing_paper":{"arxiv_id":"2605.20414","last_updated":"2026-05-25T03:05:12Z","snapshot_observed_at":"2026-08-17T01:47:26.106095Z","submitted_at":"2026-05-19T19:10:30Z","title":"PlanRAG-Audio: Planning and Retrieval Augmented Generation for Long-form Audio Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T17:56:38.345335Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2605.20414"},"observation_digest":"sha256:e65a1f2c2a949fa656d563db19771088a5e340985ab258f13af5fa4ab22d0265","observation_id":"0001a4e4-39f9-4960-b04d-3ef97dbb91cb","resolution":{"observed_at":"2026-06-30T18:04:58.380348Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":"2505.17060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-07-03T16:28:39.133843Z","title":"Salmonn-omni: A standalone speech llm without codec injection for full- duplex conversation.arXiv preprint arXiv:2505.17060","venue":null,"work_id":"5b053464-9fd0-4025-a38f-5c6ae551187c","year":2025},"citing_paper":{"arxiv_id":"2606.09186","last_updated":"2026-06-08T08:23:02Z","snapshot_observed_at":"2026-08-12T23:18:48.473844Z","submitted_at":"2026-06-08T08:23:02Z","title":"DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T15:22:02.107863Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2606.09186"},"observation_digest":"sha256:2cc89eebd8d3b377e526221916dd40699bc9803e4e175bcddba82a65cfa6277b","observation_id":"030fe35c-2674-446b-b5c0-b3fc2ffab60a","resolution":{"observed_at":"2026-07-03T03:27:34.936721Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":"2505.17060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-07-03T16:28:39.133843Z","title":"Salmonn-omni: A standalone speech llm without codec injection for full- duplex conversation.arXiv preprint arXiv:2505.17060","venue":null,"work_id":"5b053464-9fd0-4025-a38f-5c6ae551187c","year":2025},"citing_paper":{"arxiv_id":"2606.13450","last_updated":"2026-06-11T15:09:45Z","snapshot_observed_at":"2026-08-15T00:22:19.965892Z","submitted_at":"2026-06-11T15:09:45Z","title":"Endpoint Anticipation for Low-Latency Spoken Dialogue","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T05:37:17.684884Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2606.13450"},"observation_digest":"sha256:737ccaf4db41426bf9073cc69a38eaa59eb07fe71d6f8f9eae622e9bceb06f13","observation_id":"ef48b538-f88a-465d-aa40-f5f40181b7a2","resolution":{"observed_at":"2026-07-03T16:28:39.135567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":"2505.17060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-07-03T16:28:39.133843Z","title":"Salmonn-omni: A standalone speech llm without codec injection for full- duplex conversation.arXiv preprint arXiv:2505.17060","venue":null,"work_id":"5b053464-9fd0-4025-a38f-5c6ae551187c","year":2025},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-16T16:14:29.920466Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-02T16:59:50.615875Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:13c0ceed0eba3941289b6a9acc7ee0a924704f9f2ec21f338215b77f0778a982","observation_id":"e9a2a03c-406b-4b50-995a-adaea41f933b","resolution":{"observed_at":"2026-07-02T17:07:12.188616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17060","snapshot_observed_at":"2026-08-04T04:34:50.786808Z","title":"SALMONN-omni: A standalone speech LLM without codec injection for full-duplex conversation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-16T16:14:29.920466Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T04:34:50.786808Z"},"links":{"cited_paper":"/paper/2505.17060","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:900892e17fcb3427c83cec39991596c36c6061b1919db5c24a0a60d7bc7220cb","observation_id":"470b5899-a398-4a91-b2f1-467d9bdc876a","resolution":{"observed_at":"2026-08-04T04:34:50.786808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17060/citation-record","integrity":"/paper/2505.17060/integrity","json":"/paper/2505.17060/citation-record.json","paper":"/paper/2505.17060"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:49:58.085162Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.085162Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:bc1517e1a0e477239187de11aa471a6e04703a9d5bbe150711180596aa97ec94","observation_id":"6f8bc5e1-3415-4bd7-ad9b-2b64f7f5fdd2","resolution":{"observed_at":"2026-08-15T20:49:58.085162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:49:58.088931Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.088931Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:35a0c9e797604187ad4b46acb73cd9d75b6433d31eca25d79a3d143525a4b4a6","observation_id":"86422141-0234-4b2d-b414-a83dce500320","resolution":{"observed_at":"2026-08-15T20:49:58.088931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:49:58.092125Z","title":"DeepSeek-R1: Incentivizing reasoning capabil- ity in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.092125Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:b4d3e623a58565b8c7e9b2dee606c0f469c730be987e7792735ecb7bc5c444e9","observation_id":"17f35836-3acd-4093-bd65-55b3483352ec","resolution":{"observed_at":"2026-08-15T20:49:58.092125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.648648Z","title":"SALMONN: Towards generic hearing abilities for large language models","venue":null,"work_id":"a0285c6e-429e-42a2-977f-dab2dad3c17b","year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.095582Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:f5fa128e53c7eea29d9ef0e6f811d983283c931539e4bda4ca5ca1faaf771856","observation_id":"4c366b08-f12e-45a1-a39a-b2b647574e79","resolution":{"observed_at":"2026-08-15T20:49:58.651721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.640586Z","title":"Listen, think, and understand","venue":null,"work_id":"91f4c05b-34fd-408e-be0d-e827638374ba","year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.098927Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:231ed26bde2b8ca410a681b247c419313005adcf4229331df83c4a69d4e20839","observation_id":"54817caf-0997-4b07-9e7e-45c544ae5cc0","resolution":{"observed_at":"2026-08-15T20:49:58.643479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T20:49:58.102213Z","title":"Qwen2-Audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.102213Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:315a6293bb66dc4282897d270626fefd29387e4571875add1d301e8d84e627c3","observation_id":"e003506d-3d82-4363-8356-4466907ab0c8","resolution":{"observed_at":"2026-08-15T20:49:58.102213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00246","last_updated":"2023-12-30T14:20:04Z","snapshot_observed_at":"2026-08-18T01:19:08.576563Z","submitted_at":"2023-12-30T14:20:04Z","title":"Boosting Large Language Model for Speech Synthesis: An Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00246","snapshot_observed_at":"2026-08-15T20:49:58.106280Z","title":"Boosting large language model for speech synthesis: An empirical study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.106280Z"},"links":{"cited_paper":"/paper/2401.00246","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:b490b180a1025cf157682f4db6fc55424ce6a0d1cffde9ec8e728e8e6a36f205","observation_id":"93bec0d0-34bb-4c52-845a-a2456af118db","resolution":{"observed_at":"2026-08-15T20:49:58.106280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T20:49:58.110289Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.110289Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:8134bc56fe4cc18481ac50450cdb8a4a159568f888df49db7766aa63f8b43ad5","observation_id":"675fa110-ab79-4cd1-9ef2-3fcff72d1255","resolution":{"observed_at":"2026-08-15T20:49:58.110289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.118039Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.118039Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:f381a3611ee8cd6562f7894b1efac7540fab473543ec4a8123f3539625817f39","observation_id":"4c1f2931-6378-4d68-9f1a-5eb2208e23c5","resolution":{"observed_at":"2026-08-15T20:49:58.118039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-15T20:49:58.121520Z","title":"Moshi: A speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.121520Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:93b261325e6b82370a7cd6e1be3c10387c661372f54e7677d4f491652306f592","observation_id":"0d9e9fae-f321-4dbe-b423-16acc5ea36b7","resolution":{"observed_at":"2026-08-15T20:49:58.121520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.625274Z","title":"LLaMA-Omni: Seamless speech interaction with large language models","venue":null,"work_id":"d050abc7-2606-4567-b4e9-1998b941ef5b","year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.125030Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:a45fd9d52ae1f6d074c66b376ddead7e6445bc4d6dee069437b7d46b46d52703","observation_id":"56099895-2d65-4127-bd92-c82389113659","resolution":{"observed_at":"2026-08-15T20:49:58.629655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.617062Z","title":"Spirit-LM: Interleaved spoken and written language model","venue":null,"work_id":"acf6a3ae-39e1-4184-96f0-a563c5bc5eab","year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.128306Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:076784e98033e546437fa362842677327d72ac5c0a06ab2077dcd25135de10bd","observation_id":"f90d1971-022b-41b1-9452-738d00b77af7","resolution":{"observed_at":"2026-08-15T20:49:58.619872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-08-20T16:00:12.325133Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-15T20:49:58.131650Z","title":"Mini-Omni: Language models can hear, talk while thinking in streaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.131650Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:5dcde275a24b1420f35007997219f456238c24ce155462477a9c00f1330361fe","observation_id":"231eaac7-9fc4-4c13-ba36-66127ba8ffe7","resolution":{"observed_at":"2026-08-15T20:49:58.131650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-15T20:49:58.134642Z","title":"GLM-4-V oice: Towards intelligent and human-like end-to-end spoken chatbot","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.134642Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:df9e560e3b0821d86af053e2778e4f8661239715ed075ac2047cde7837d77a07","observation_id":"739b44ef-b6a2-489e-bdfd-486f9aa8cf9a","resolution":{"observed_at":"2026-08-15T20:49:58.134642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.137540Z","title":"Beyond turn-based interfaces: Syn- chronous LLMs as full-duplex dialogue agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.137540Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:3dec566f7c022f6a60d3f029a8405ac3a1232f1d1bcc846f3bc23b1b24e99583","observation_id":"ecb017c2-ac14-4fc6-a3d0-b50eb6ea12fe","resolution":{"observed_at":"2026-08-15T20:49:58.137540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-08-16T13:06:39.141902Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-08-15T20:49:58.140836Z","title":"OmniFlatten: An end-to-end GPT model for seamless voice conversation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.140836Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:22546a82b07e0e032ea66061d3adb3a185a6c01d6a65f04c139d4b7619bd83eb","observation_id":"2837a4c3-fcda-4c60-b9a3-ff1ba5d66d08","resolution":{"observed_at":"2026-08-15T20:49:58.140836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.605047Z","title":"Talking turns: Benchmarking audio foundation models on turn-taking dynamics","venue":null,"work_id":"68e0277d-efa6-4f6d-a4ad-dfb8ce058e0b","year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.143685Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:03e699c0f0ba9631a1f55c187d3156a14558d916d998456ee39549a73843aede","observation_id":"50a42bbd-10ad-41f3-84e1-02ba9cc7c3e9","resolution":{"observed_at":"2026-08-15T20:49:58.607870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-20T07:59:47.616406Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-15T20:49:58.147040Z","title":"VITA-1.5: Towards GPT-4o level real-time vision and speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.147040Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:4c0706343419ab37c316f6ffab984e9578d92548deb6cae126d4613c826caa50","observation_id":"583367b8-f255-416f-b385-d2ac3dd7fbd0","resolution":{"observed_at":"2026-08-15T20:49:58.147040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-16T13:03:42.737566Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-15T20:49:58.149680Z","title":"Freeze-Omni: A smart and low latency speech- to-speech dialogue model with frozen LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.149680Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:ac115366971b803ccef6094a3a459b846ed3df1711c0fcb6cc35461ce1fca3d3","observation_id":"79305b73-1c7a-448a-9778-1edf396083e3","resolution":{"observed_at":"2026-08-15T20:49:58.149680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-15T20:49:58.152800Z","title":"Kimi-Audio technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.152800Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:8f46723bbdd8cff16c06047fceccb6783459c771a6225820b999d5409cae4077","observation_id":"6e30344c-e13b-49bf-a9ed-1599b06c7eeb","resolution":{"observed_at":"2026-08-15T20:49:58.152800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-15T20:49:58.156421Z","title":"Qwen2.5-Omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.156421Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:4bf5b3bd5c384cb87c7ab8cb7faee17c12b493819814445cec5aaea622b4667f","observation_id":"c8735e97-e5a9-4209-81d9-84a83e26138c","resolution":{"observed_at":"2026-08-15T20:49:58.156421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.159734Z","title":"POMDP-based statistical spoken dialog systems: A review","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.159734Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:9c73e764b5467612236ce035fd4510066ce0422225a3905f1faf60d8b64a55a0","observation_id":"05e232ff-1b66-454e-a2f0-5cb41330643b","resolution":{"observed_at":"2026-08-15T20:49:58.159734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.594602Z","title":"A neural conversational model","venue":null,"work_id":"c94a7c68-bb88-4110-b6ad-612fe356926b","year":2015},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.162275Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:7c05d9029aae80b47bfcb83d744bdc8760e5c5ec2454489c7eddeceb0f03a920","observation_id":"eed314f8-dc09-4254-af30-586cfc73b979","resolution":{"observed_at":"2026-08-15T20:49:58.597565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.587614Z","title":"Building end-to-end dialogue systems using generative hierarchical neural network models","venue":null,"work_id":"8c3b4445-6d1e-432d-a19c-57aa520294c9","year":2016},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.166005Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:88648e30044f28606a24533ef5d167edc92ef5ad494948bf3180a1b3b28573df","observation_id":"5fd6d634-3dea-4fdb-91f6-0ac4fc15259b","resolution":{"observed_at":"2026-08-15T20:49:58.590040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.578111Z","title":"MiniCPM-O 2.6: A GPT-4o level MLLM for vision, speech, and mul- timodal live streaming on your phone","venue":null,"work_id":"75a01075-19cb-4850-a1b5-547c2b0cc19b","year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.169401Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:7ad95922414a9451a23c04fd977237cd0b8190a42c5d864ebc37f96ee821f5bb","observation_id":"b3310856-a2ff-4889-8240-7e2a8336ff69","resolution":{"observed_at":"2026-08-15T20:49:58.581740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-16T12:55:42.223198Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-15T20:49:58.172025Z","title":"Baichuan-Audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.172025Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:6fff680de363e42d03c3b0545d063eb6fea9b740b12a3ae8bc77c0f8fb991c08","observation_id":"78287fd3-c86c-448a-a5ce-0c5c0a266b32","resolution":{"observed_at":"2026-08-15T20:49:58.172025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-13T18:35:10.938726Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-15T20:49:58.175649Z","title":"MinMo: A multimodal large language model for seamless voice interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.175649Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:92e0355dc5921b5bec7f0401f549d7acfb0cebc662b66eac2ffba7ad58b32462","observation_id":"34b70932-5755-41b0-90f4-6ac9cbb1fd62","resolution":{"observed_at":"2026-08-15T20:49:58.175649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.571810Z","title":"Generative spoken dialogue language modeling","venue":null,"work_id":"c5080fd0-0050-4ef7-ae6d-638d70b48744","year":2023},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.179249Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:325e3425ba8c629ed8454caff43b0728761cc399325331ba976e6cd46a9afc67","observation_id":"f3b591c2-11bb-4ae7-add7-87c52aef8f42","resolution":{"observed_at":"2026-08-15T20:49:58.574275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.565393Z","title":"Optimizing expected word error rate via sampling for speech recognition","venue":null,"work_id":"18360a09-84bd-405c-ac6b-04b359c87932","year":2017},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.181849Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:1f1c98b6f89832c76898205df47490301765ed488bf970cb63d38da98e4abdb7","observation_id":"67eec411-3f40-4ed3-ac22-b332e798afe4","resolution":{"observed_at":"2026-08-15T20:49:58.568098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.558751Z","title":"Variable Frame Rate Acoustic Models Using Minimum Error Reinforcement Learning","venue":null,"work_id":"162b8a31-10b3-4d3d-90e1-800a4d5b8dcd","year":2021},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.185032Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:dea0721d020ea74ea6c8d79dc27549ee08646dcee67a267cf6bdbc5998491167","observation_id":"67ef88ab-2bbc-4dce-ace0-fda76e1e0749","resolution":{"observed_at":"2026-08-15T20:49:58.561207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-08-16T13:36:42.713695Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-15T20:49:58.188741Z","title":"Seed-ASR: Understanding diverse speech and contexts with LLM-based speech recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.188741Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:d27e1c2578a2d63dcbd0e2679dcef5a6802ca99180bef0b66b23c3f02d0b228f","observation_id":"aada64ff-0e23-4d7e-8287-9a4d7a9d7ece","resolution":{"observed_at":"2026-08-15T20:49:58.188741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.550901Z","title":"Speech recognition with LLMs adapted to disordered speech using reinforcement learning","venue":null,"work_id":"fc20f6ba-c7e1-4de1-b40e-74592dd0a78c","year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.191471Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:461b87eb6c17601a6c52f60ded464263cef2f084815280f92bcbf7876caf5e17","observation_id":"caaa36f8-9ae8-4c79-affc-d61d5b1f7315","resolution":{"observed_at":"2026-08-15T20:49:58.553550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.544500Z","title":"Reinforcement learning for spoken dialogue systems","venue":null,"work_id":"2d989eb3-cc58-4a28-ba40-dc9a39809f20","year":1999},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.194107Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:66effa3f6a0d51d71f1384fb3c3dcbddeb710f88039ada5f5ff4dd69906c13ff","observation_id":"c1a834b9-609e-4429-825f-184fcc3c9d26","resolution":{"observed_at":"2026-08-15T20:49:58.547112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.537680Z","title":"Automatic learning of dialogue strategy using dialogue simulation and reinforcement learning","venue":null,"work_id":"595659b2-0b26-4f88-9eae-c841d4b71d7c","year":2002},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.196626Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:b92e096a9ced0ea3b12c3b336f72295dc22d031d1ceada331179b0f327c1f3c8","observation_id":"f0a7409e-0094-4375-aae8-b56a72ed629c","resolution":{"observed_at":"2026-08-15T20:49:58.540537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.528343Z","title":"SpeechAlign: Aligning speech generation to human preferences","venue":null,"work_id":"d6dba857-1c42-4cf8-b24c-455e410acd6b","year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.199241Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:13a1c74b8c5b0ba23c9d454e6c79bf65b2dd9ce72136525da662ebdc8b7015e6","observation_id":"7b71ea8f-e9e3-43c9-9f18-fbcedaa11903","resolution":{"observed_at":"2026-08-15T20:49:58.531123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-08-16T13:47:03.288626Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-15T20:49:58.202244Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.202244Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:3b69e1f2f54300e5f2d6ed2a74060d6c7c13bb351ea7883b8a11dbd0797fb37d","observation_id":"5d4cbd6d-ae50-471b-9d80-3530c4c2bf08","resolution":{"observed_at":"2026-08-15T20:49:58.202244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-15T20:49:58.206116Z","title":"Seed-TTS: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.206116Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:6dfa32df2ad012c047ab5d2976c95eeec269bb67a3313c21991b75ff40a71f3e","observation_id":"c2a291e0-faca-4c74-ab4e-794366f69776","resolution":{"observed_at":"2026-08-15T20:49:58.206116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:49:58.209597Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.209597Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:6f18bf875071c41d3d3dc2cd78159426e9cd27e404db9412c67e91e513ff9e09","observation_id":"4f063694-7994-4176-b213-db3cbe1eb8e7","resolution":{"observed_at":"2026-08-15T20:49:58.209597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.520687Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"2b2d1507-22cb-477d-a6f3-e54948e00196","year":2023},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.212886Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:6fb94e54dfe4de2702bc5c68a49d8f582f867a81747fa682a8ab231d6e5102b7","observation_id":"6accb4ed-1745-4af5-9312-ee5eed170f28","resolution":{"observed_at":"2026-08-15T20:49:58.523466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-15T20:49:58.216006Z","title":"Step-Audio: Unified understanding and genera- tion in intelligent speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.216006Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:9befa31df8077d2ed0d14cfef2043d850818de3910943684d9cbb3d0b5137f34","observation_id":"e606dcc9-01cd-4edd-9e0c-fe8c7aff0756","resolution":{"observed_at":"2026-08-15T20:49:58.216006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17010","last_updated":"2025-02-20T11:13:23Z","snapshot_observed_at":"2026-08-16T13:15:27.648803Z","submitted_at":"2024-09-25T15:15:42Z","title":"MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events","version":4},"cited_work":{"arxiv_id":"2409.17010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.17010","snapshot_observed_at":"2026-08-15T20:49:58.300928Z","title":"MT2KD: Towards A General-Purpose Encoder for Speech, Speaker, and Audio Events","venue":"eess.AS","work_id":"9e9073e0-c0f7-4c75-ac9b-579e41453e0f","year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.218894Z"},"links":{"cited_paper":"/paper/2409.17010","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:89c82f9d5a1f72ce32563f3deb476e4ce0111df7e6599a54f7d1706b563b2a97","observation_id":"415ae299-5a84-4b92-b7b1-b46549798e4b","resolution":{"observed_at":"2026-08-15T20:49:58.306059Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.513701Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"ca828e36-6f05-4b39-b0d5-97fd95e79a71","year":2023},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.221621Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:45ff798f496b08373b320f028e1ee8a3ef5b34a75824d6e8be59c00fd909bae1","observation_id":"9db483e3-264e-4ae3-a332-59532e93ef57","resolution":{"observed_at":"2026-08-15T20:49:58.516339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.505680Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":"bcfab870-690f-456d-8917-82477753e3ef","year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.225462Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:8191931098b611496cbd12f69c9cca3edd17083ea8f329913f0d8ebff9078d04","observation_id":"b54a9c58-8550-4ae9-9d3e-1537a16cf97a","resolution":{"observed_at":"2026-08-15T20:49:58.508291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-15T20:49:58.227998Z","title":"CosyV oice 2: Scalable streaming speech synthesis with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.227998Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:3898a29a8cef484a0fd8fc829d844bc1583e0ba871e89ddb7af1344b1b5e266e","observation_id":"474c5e20-6729-43f7-b999-8f2a2e8b3504","resolution":{"observed_at":"2026-08-15T20:49:58.227998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.497254Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"4c9344a8-9959-47f9-bed9-3b6d66334115","year":2022},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.230256Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:7cd406fc872c7badc2aaefd818ee76a579bdf0c74869dfe138369cb81b3a73ce","observation_id":"9640781a-ed15-4829-b666-ec26ce945897","resolution":{"observed_at":"2026-08-15T20:49:58.499882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.490336Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"4c30d48b-fda1-43c3-b808-81c39fb72737","year":2015},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.232547Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:3b694d5b584e28ee8a40a6202d08617cb0222d2ecdc7f2d219d8d78fb7499b2e","observation_id":"75d5e047-79e7-4841-a7de-d39d0506e9f1","resolution":{"observed_at":"2026-08-15T20:49:58.492920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.482875Z","title":"GigaSpeech: An evolving, multi-domain ASR corpus with 10,000 hours of transcribed audio","venue":null,"work_id":"17bb7e6e-5b30-4228-bf09-39df851807a7","year":2021},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.235198Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:713d4082cf9ad1193658b2a5342841c82b767fd41694df452d59391221c6be1e","observation_id":"6cbb1e05-cec9-44c9-bfc4-3277c8cf121c","resolution":{"observed_at":"2026-08-15T20:49:58.485609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.474367Z","title":"Stanford Alpaca: An Instruction-following LLaMA model","venue":null,"work_id":"6f534777-9a58-4f90-8d89-d962826ff9e2","year":2023},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.237542Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:d9ef3bc761110a63cc6043c4d729ecb207a6565f987cb57737acc5d9f72296c6","observation_id":"8dd047a0-5d66-4127-807b-769a79bd7b03","resolution":{"observed_at":"2026-08-15T20:49:58.477982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.466408Z","title":"Semantic parsing on freebase from question-answer pairs","venue":null,"work_id":"13e19882-d468-4920-bb73-97fdfe8b1d63","year":2013},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.240895Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:70c9aa06e7b80bf0af024e0144649ad3cd3f09d6905f041422d3b53046d80ccb","observation_id":"736be314-e242-4179-939c-d826a178bb82","resolution":{"observed_at":"2026-08-15T20:49:58.468952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.457363Z","title":"TriviaQA: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":"d7716cd2-ff09-40d2-85cf-1d5edc14a5ad","year":2017},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.244083Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:722b8447a76e0bfb20128fdba6a4b867cf817b8d0ce9a7bf2a18da34c2e53e53","observation_id":"38231fa3-dcfd-4dad-9ac0-ae611a2456b7","resolution":{"observed_at":"2026-08-15T20:49:58.459946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.449402Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","venue":null,"work_id":"a00c25d8-84ab-406b-b5f5-8181640a8e1c","year":2016},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.247880Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:183f4c1f0b1721c3518a2041e712cb147f2efb0b9c5507c4598c1cc1fea106e2","observation_id":"fce24798-0a6d-468b-a8aa-0256a9f0b58a","resolution":{"observed_at":"2026-08-15T20:49:58.452790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.441209Z","title":"Natural questions: a bench- mark for question answering research","venue":null,"work_id":"5f99ad95-8e3d-47d8-80ca-80f370c4dc54","year":2019},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.250802Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:6c1df7ab0d0789923a18e0704c87864be452cc168bb20029299f2dfd42c23198","observation_id":"e0b9b03d-c329-4c72-8b7b-9198e0d20203","resolution":{"observed_at":"2026-08-15T20:49:58.443987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-12T05:23:04.133755Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15649","snapshot_observed_at":"2026-08-15T20:49:58.254721Z","title":"SLAM-Omni: Timbre-Controllable V oice Interac- tion System with Single-Stage Training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.254721Z"},"links":{"cited_paper":"/paper/2412.15649","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:245eeb3128ac89105dbd496d9940367e2b3a9cb5bc3467f8962ec1789195bc2a","observation_id":"5e189fb4-7b27-416c-932d-4bf450e13f64","resolution":{"observed_at":"2026-08-15T20:49:58.254721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.434030Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM","venue":null,"work_id":"4895ed6d-627b-4c77-9ad9-f393f0e31f88","year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.258540Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:c8780f36c2fbb995f6c3a9e5124b992b999717b7b2b4fa4a1d1396b647d25e3f","observation_id":"aaa11f80-04e7-4137-8e45-5b6879108a55","resolution":{"observed_at":"2026-08-15T20:49:58.436845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-08-17T12:45:25.032324Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-15T20:49:58.261672Z","title":"V oicebench: Benchmarking llm-based voice assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.261672Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:79ffe1b700973a287008d4012ddf95bb294b42eaf9a5ca3790f87b79340fd5f9","observation_id":"8d4e848b-2fbe-42f9-85f3-5c78b1ff0a44","resolution":{"observed_at":"2026-08-15T20:49:58.261672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.265684Z","title":"Libriheavy: A 50,000 hours ASR corpus with punctuation casing and context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.265684Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:cf5035581b647f8ca07e1b8af4e52d6792ba0d6f2f542ad2b54735f109d0bd72","observation_id":"8f4e6452-14da-4f99-95f1-7285e8ca33da","resolution":{"observed_at":"2026-08-15T20:49:58.265684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:49:58.422534Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"ae844f26-db74-4537-861f-cbf9b1f42d53","year":2019},"citing_paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:49:58.269093Z"},"links":{"citing_paper":"/paper/2505.17060"},"observation_digest":"sha256:1e1a0ffb3ea5a495481f925b933b24c56dc8d0bf61431fc36110f74d04fcd028","observation_id":"40d9929c-44ad-4226-940a-9e19eb151933","resolution":{"observed_at":"2026-08-15T20:49:58.425949Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17060","last_updated":"2025-05-17T08:13:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T11:24:37.939766Z","submitted_at":"2025-05-17T08:13:59Z","title":"SALMONN-omni: A Standalone Speech LLM without Codec Injection for Full-duplex Conversation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 10 inbound Pith citation observations for arXiv:2505.17060."}