{"as_of":"2026-08-06T06:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a14f3cd239b31047f5a25471b3ba5efc4837442a53c53c4ebfb536b86dcddf6b","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T02:38:31.073805Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06540/citation-record","integrity":"/paper/2607.06540/integrity","json":"/paper/2607.06540/citation-record.json","paper":"/paper/2607.06540"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-03T04:23:51.274879Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:fcf1ce4d6f98c82f3425ff1fc10ef0544cb994e732e0364a9c3ffc126f47abea","observation_id":"8073a5d3-d128-478a-b0dd-314009358cc1","resolution":{"observed_at":"2026-07-08T02:44:27.619878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2507.16632","doi":"10.48550/arxiv.2507.16632","metadata_source":"pith","pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Audio 2 Technical Report","venue":"cs.CL","work_id":"2317bc9f-2d58-4e53-b7ea-804337e9fdef","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:75f4536a420d29ff0deaffb6c9629be092e98cc4101f01109be433d9e75c722d","observation_id":"c464032b-e06d-4e02-a8be-4caf6b8ddb17","resolution":{"observed_at":"2026-07-08T02:44:27.622641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.521","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024 , address=","venue":null,"work_id":"410a0db1-f6c1-4676-9ac8-6d4ef1a01f32","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:40ee6088abb65897bc7428231f82cab1892e3187683d0c475b37a8f963173ea1","observation_id":"48bbfcc1-b184-4205-bb7a-5e9d6afab943","resolution":{"observed_at":"2026-07-08T02:44:27.593264Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:45.790058+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:45.790058+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.076282Z","title":"2024 , url=","venue":null,"work_id":"e57da2ef-9b94-4590-b4d3-4403daea8f01","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:84d54bff003a719c8cc37934f3d826c532b8207adbbef6ad7263b4e62fcaa9dd","observation_id":"2f8696ee-4a67-4815-bcff-afd98723668d","resolution":{"observed_at":"2026-07-08T02:54:28.077768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.099308Z","title":"Forty-second International Conference on Machine Learning,","venue":null,"work_id":"4e061238-73f0-4c6d-9784-dcbc31128af1","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:017137dafba4194504c5767cbcb6f3dc87c9020bc670709a18f55e30f2beedd0","observation_id":"71aa6349-892f-47e6-90b7-d88dbe56116e","resolution":{"observed_at":"2026-07-08T02:54:28.100722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12609","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:44:28.046650Z","title":"Uni-moe-2.0-omni: Scaling language- centric omnimodal large model with advanced moe, training and data","venue":null,"work_id":"c6c1f0b6-c392-408a-8351-e1430705b226","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:a41cc008dc3770b187f9002f644a6f9635afb453275f0c1424dc8edf56125f14","observation_id":"c86075f5-e121-40e1-a278-6fd8a71ccb56","resolution":{"observed_at":"2026-07-08T02:44:28.048237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-07-06T21:20:41.212212Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.04921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04921","snapshot_observed_at":"2026-07-08T02:44:28.049569Z","title":"Perception, reason, think, and plan: A survey on large multimodal reasoning models","venue":"cs.CV","work_id":"18ce98be-3cf0-4e03-b05f-ad32a6306ca2","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2505.04921","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:da11ae7c5993713ed96381a6e1e1c2c12db472e95981f60566b7f4da0d0b6430","observation_id":"9729d942-8013-4e75-8fe9-66e95fc67465","resolution":{"observed_at":"2026-07-08T02:44:28.050948Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:369c119ddddc8b6263271bff9c5a6caa40b1d8ebc855100a537faace5ff30f5b","observation_id":"19139c8e-60ea-44c7-af10-fbc94cf36280","resolution":{"observed_at":"2026-07-08T02:44:27.603525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":"2501.01957","doi":"10.48550/arxiv.2501.01957","metadata_source":"pith","pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","venue":"cs.CV","work_id":"510354f3-222a-48da-bda9-96a2df30bb68","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:19c79527b267fa49e1de6ebaa145c795d58e2a053a8a19774a825d2a1ebfd5c9","observation_id":"fd1aa9dd-4430-4e02-9d67-b0bf7431296d","resolution":{"observed_at":"2026-07-08T02:44:27.588649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.644","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond the Turn-Based Game: Enabling Real-Time Conversations with Duplex Models , booktitle =","venue":null,"work_id":"472a8575-02d1-40ab-ab6e-99ba05891ceb","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:02b40448f9a1adc95c7e8dc15ea5741eb6972cd78a43da5f8cc97d04c859c7fd","observation_id":"1cda6be4-a74d-4dc3-a973-d78313f6864a","resolution":{"observed_at":"2026-07-08T02:44:27.558902Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:47.015104+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:47.015104+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.088459Z","title":"OmniFlatten: An End-to-end","venue":null,"work_id":"f1104b8b-d3a8-4914-a715-a7d1284ec955","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:fed4b5b83fbe99b1c380870ad7f0c60144e1d6a4b2e60614fdb96628f5499493","observation_id":"3de0d2c6-4aa5-4f65-b43e-e196dba0f7de","resolution":{"observed_at":"2026-07-08T02:54:28.089646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1192","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Peloquin and Bokai Yu and Hongyu Gong and Shyamnath Gollakota , editor =","venue":null,"work_id":"4a0abf07-6635-4568-bd99-54df8f7ea6a4","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:25b2668f7558829d9264016472c0853e31321d24b93fcba64a918352bbb03cab","observation_id":"8dcc24d8-05fc-445c-a6d6-318d25da1e6c","resolution":{"observed_at":"2026-07-08T02:44:27.611459Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:47.388177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:47.388177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":"2307.03172","doi":"10.1162/tacl","metadata_source":"pith","pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lost in the Middle: How Language Models Use Long Contexts","venue":"cs.CL","work_id":"37c05e13-4a24-44f8-a1c4-da1bbe7223aa","year":2023},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:855c4d5cbf9d654d0f2b60e51a191dad0232e94df28a22508fdb6eaf698ee14a","observation_id":"f3b0cc80-33c5-45ed-bc8e-d462660701fa","resolution":{"observed_at":"2026-07-08T02:44:27.607375Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.02521","doi":"10.48550/arxiv.2509.02521","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flm-audio: Natural monologues improves native full-duplex chatbots via dual training","venue":"Open MIND","work_id":"836eb1ee-cc6b-43c3-9eed-d4c77ebd4d27","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:624efed14966599ec8da01fff4c6e060926135ef02ba0e8e0deea49404de9680","observation_id":"7692298f-d65c-4698-8233-d1eee4103afb","resolution":{"observed_at":"2026-07-08T02:44:27.594063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:47.823313+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:47.823313+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-04T23:33:03.953143Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:a5c5655bc90d034f26b37f26e4e6f6e5483660958a12515e0385d89e9b148314","observation_id":"a16fb13d-a686-47bf-abd6-aa0345df9fa1","resolution":{"observed_at":"2026-07-08T02:44:27.639858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13472","last_updated":"2025-05-29T03:32:21Z","snapshot_observed_at":"2026-07-06T20:39:02.049006Z","submitted_at":"2025-02-19T06:51:34Z","title":"FlexDuo: A Pluggable System for Enabling Full-Duplex Capabilities in Speech Dialogue Systems","version":2},"cited_work":{"arxiv_id":"2502.13472","doi":"10.48550/arxiv.2502.13472","metadata_source":"pith","pith_arxiv_id":"2502.13472","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"acoustic to- kens","venue":"cs.CL","work_id":"7d46a569-944a-4b5d-a1bf-c0772174cd36","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2502.13472","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:0edd5a0dc2c4f96fa2e51e4196e232a538cb034cce61be298283f87a97ea806e","observation_id":"6b85cadf-c3c0-4c47-83fd-d67304d4995a","resolution":{"observed_at":"2026-07-08T02:44:27.581178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.685549+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.685549+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23938","doi":"10.48550/arxiv.2509.23938","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Easy turn: Integrating acoustic and linguistic modalities for robust turn-taking in full-duplex spoken dialogue systems.CoRR, abs/2509.23938","venue":null,"work_id":"96a8568f-0397-43f0-9555-f21e77ec7036","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:7a92bfa99bf627af4f4bd70c913e470283325e4c48877f468ce5c1a1a633535a","observation_id":"f0ad6e29-4569-4f31-b8f9-9d6330632f51","resolution":{"observed_at":"2026-07-08T02:44:27.625563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.056222+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.056222+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.1055","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"a2a248aa-eb9c-4cd4-acc5-5748a8d70772","year":2023},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:5b310e02deaed5c019f1d07ad1b472813665ace2789221cdba3ca2bfcf1ba612","observation_id":"bb850aba-42a8-432d-9624-3ba7af116bdb","resolution":{"observed_at":"2026-07-08T02:44:27.609250Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.54762+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.54762+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.082896Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":"428ecd87-4736-4572-9580-5bad64df63ed","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:571a4f340cc86253817049a96272bf2825dc99bc35cf569de040ce29ee710163","observation_id":"4ec6d432-c6c4-4a2f-8371-029317a04ab3","resolution":{"observed_at":"2026-07-08T02:54:28.084664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.099114Z","title":"The Thirteenth International Conference on Learning Representations,","venue":null,"work_id":"77f6c54f-7d36-4eec-84fe-6153a2f89307","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:076d5e033821e6fc9811c34edb69053e517cd0bcd0a5ff570eb0a40180a500a4","observation_id":"98702d34-2181-4dfb-9741-b879160a4d84","resolution":{"observed_at":"2026-07-08T02:54:28.100942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.090265Z","title":"2025 , eprint=","venue":null,"work_id":"86165d7e-7e0e-49a7-b62e-4d76ef06bb35","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:2997d2d1528a42981ba9c07976740fd7c81284204f54d7771bda5c6603088848","observation_id":"df695be2-4cf6-4ea1-8e23-298e240f1ed5","resolution":{"observed_at":"2026-07-08T02:54:28.094402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:cb4d8d2edbe61b04af91d321f8ecc1d3ab7e755288eaa5c6f6d0ecfa78f7f00e","observation_id":"2c7b9d4c-a8a2-4f96-839c-0ae026565842","resolution":{"observed_at":"2026-07-08T02:44:27.628391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.094613Z","title":"7th International Conference on Learning Representations","venue":null,"work_id":"720fa3bd-ab00-426a-857b-d0c8a56061d1","year":2019},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:1cc5875e80fd96f33211731a7873b827184a50c7a3cb286538bb097a1b94e66d","observation_id":"6be500fc-2793-402f-975c-3daafed552c8","resolution":{"observed_at":"2026-07-08T02:54:28.096341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.151","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Findings of the Association for Computational Linguistics:","venue":null,"work_id":"4aace360-5719-4189-b6b6-3b5287d3e1cf","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:2435afc40107c7d6e90accca55282a6a82d4ee642b41f920a29fc54e18e50b7c","observation_id":"6470b60b-ec4d-4ee5-b57f-6e176d9dbf5a","resolution":{"observed_at":"2026-07-08T02:44:27.572967Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:50.368136+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:50.368136+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":"2408.16725","doi":"10.48550/arxiv.2408.16725","metadata_source":"pith","pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":"cs.AI","work_id":"5192d640-6f69-48bb-b5e7-c2eb57e52726","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:3d6737d56563a48d1bc05330265c62ee7734e1c127ee220917a0fa10e1641d0f","observation_id":"a9882f2e-28c4-475b-82ab-4e6b4265cb3a","resolution":{"observed_at":"2026-07-08T02:44:27.587484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.090093Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision , booktitle =","venue":null,"work_id":"836910ca-f083-415c-ac2a-94ae34628ce9","year":2023},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:a7435fb6202bbd2250008e3f5076e70a7256019afaaff4f3d19f75643fd1c3fc","observation_id":"3d380d32-e552-4c0e-9c67-8297676ce432","resolution":{"observed_at":"2026-07-08T02:54:28.093626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2025-739","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FD-Bench:","venue":null,"work_id":"151983a5-3411-4536-b1dd-02baf82b5b98","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:bf976fc933719f87f679e9ac4a6cf9dc2251e9b6916fea9dd9f334bac7e7ed71","observation_id":"091daa65-d903-4158-8aac-c1421ad65188","resolution":{"observed_at":"2026-07-08T02:44:27.598548Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.083976+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.083976+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-02T17:53:21.058380Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:0004b89c600b7dfd40970622109d9068e7ffd6b7f1afd8bf739b682e5a79630e","observation_id":"4c58e7d2-efcf-4901-a686-426ef16586fb","resolution":{"observed_at":"2026-07-08T02:44:27.586165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2022-439","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Interspeech 2022","venue":"Interspeech 2022","work_id":"e2710c48-0be2-462f-8daf-593a4233fd65","year":2022},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:6508c9a09074de2dc569d9e89338b8956da0d35dd19b23c3516670120737ed1e","observation_id":"197231e1-4ef1-416b-b0e8-2ef3841b8fee","resolution":{"observed_at":"2026-07-08T02:44:27.613541Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.806787+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.806787+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":"2407.04051","doi":"10.48550/arxiv.2407.04051","metadata_source":"pith","pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Funaudiollm: Voice understanding and generation foundation models for natural interaction between humans and llms.arXiv preprint arXiv:2407.04051","venue":"cs.SD","work_id":"7cd6d289-dca2-414f-99e0-809f37c065fa","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:bf95d37570a316067c3561ac728dce2bd9213840fd1fd6144476b083cbbc78e9","observation_id":"72153fe9-cf18-4895-a9fb-96c33f9c8cef","resolution":{"observed_at":"2026-07-08T02:44:27.616822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:52.218158+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:52.218158+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.085751Z","title":"ArXiv , year=","venue":null,"work_id":"17ac3608-6af7-4069-b6ae-e7441a99e069","year":null},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:60b89011d364db79c5ac1872c7e5ee6bc56de19f76fc23f0aaeb63a50f3d42e8","observation_id":"e27ccfc7-4414-4250-83e8-d30fb0de5281","resolution":{"observed_at":"2026-07-08T02:54:28.089467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.02967","doi":"10.48550/arxiv.2601.02967","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moe adapter for large audio language models: Sparsity, disentanglement, and gradient-conflict-free","venue":"arXiv (Cornell University)","work_id":"f627f722-810b-4303-b3ba-535153e3253c","year":2026},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:aa04382739ef6e036ab6db525936ff78e9bf4ee6caeb1335baf15c96ad176e3f","observation_id":"f3da0420-87d6-43a9-b592-8926a5bed2a0","resolution":{"observed_at":"2026-07-08T02:44:27.604524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:52.695211+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:52.695211+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T04:30:24.984220Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:54d0906d5d081e3f3d6e8a8d6985475e2c4e52ca6197f70f7aff10a3bf0bb495","observation_id":"b65231ce-691f-49ab-bddc-1b16309664a0","resolution":{"observed_at":"2026-07-08T02:44:27.611257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.097302Z","title":"On The Landscape of Spoken Language Models:","venue":null,"work_id":"e6d1fdd9-401f-4e17-9ab4-e85a06a1c115","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:e7c03390a4361dea9e5c9971888db89cf030f856208457c1040d9eebfe297613","observation_id":"5eecad0f-c386-488b-a254-31dad33f4ff2","resolution":{"observed_at":"2026-07-08T02:54:28.098690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4678.353920","doi":"10.1145/3534678.3539209","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Duplex Conversation: Towards Human-like Interaction in Spoken Dialogue Systems , booktitle =","venue":"Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining","work_id":"34b7b4ff-e411-4210-82b0-ba3625369a00","year":2022},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:c5ddbeb419083afcf04cd52253ab0aa003befda34fad1ca8e136d2d1fc3c68d9","observation_id":"742c147c-3090-44e2-a8ca-453d497e52b9","resolution":{"observed_at":"2026-07-08T02:44:27.584536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.653094+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.653094+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2025-874","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient and direct duplex 14 DuplexSLA modeling for speech-to-speech language model","venue":null,"work_id":"093dca9c-afaf-438e-b6c9-3d8f3a6dfdd7","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:a0f5a3ad619c8d7e743f9e23d77aa0828a7da6aa1ee463933d48aea835e45017","observation_id":"6c40db74-d2fa-4534-82f6-d7499846db9c","resolution":{"observed_at":"2026-07-08T02:44:27.595665Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:54.030333+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:54.030333+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6598.371422","doi":"10.1145/3706598.3714220","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM integration in extended reality: A comprehensive review of current trends, challenges, and future perspectives","venue":null,"work_id":"de8d4d16-2a0e-4791-b240-6a4584e66f8f","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:a5402b970edbe4cfe22e19b151ce4898a9ce42bfe38b3dc3a95918f715b3f0eb","observation_id":"b8384b0e-3f14-40fb-b734-08764e7fb9a1","resolution":{"observed_at":"2026-07-08T02:44:27.636629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-02T00:48:35.917604Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":"2502.09940","doi":"10.48550/arxiv.2502.09940","metadata_source":"pith","pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A preliminary exploration with gpt-4o voice mode","venue":"cs.CL","work_id":"2473cd1d-7c86-46cb-aa17-1cbff7848bb9","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:6f4a33f1f9211af370ecc249783e145c51d9a1181898d6e71910b9a2923666e2","observation_id":"21f6f1e5-7025-4737-8c84-c0a4aed49abd","resolution":{"observed_at":"2026-07-08T02:44:27.576608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.121080Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":"40ad3957-b18b-4456-994a-b4b4631a2620","year":null},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:9989f47e4059bdc259a4017875e763c2df32f1a1e7ed818be0bbca27ddf70bbd","observation_id":"2138829a-7b48-4d70-b364-2890d40b492a","resolution":{"observed_at":"2026-07-08T02:54:28.122930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.095037Z","title":"Schegloff and Gail Jefferson , journal =","venue":null,"work_id":"1493bcf4-1c2c-4f77-b9ea-0d453473b879","year":null},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:4f2b1f6b0d28ba26ddb8e15478e025aff5669bf6a9f670a4e134ce5bdd647b38","observation_id":"45215517-5e2e-4a33-8210-ccebfc14e0f3","resolution":{"observed_at":"2026-07-08T02:54:28.096738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:f0ad45e707bd881583e72de11a2082bfd195f35f4672538312a9bb91d70a6a79","observation_id":"f3c58321-cb36-4240-af14-d8bdfa193b68","resolution":{"observed_at":"2026-07-08T02:44:28.045394Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.083826Z","title":"and Sifre, Laurent , title =","venue":null,"work_id":"4d76fcc0-f1da-4d6f-a1ea-6817d49cc734","year":2022},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:4ae346ba3cea395d5ee24a2b8f28e3377ce808f6490a3c3d03ffadb7d1612926","observation_id":"9e87f6db-149f-461b-9912-f78fde4bd2a2","resolution":{"observed_at":"2026-07-08T02:54:28.085448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05098","last_updated":"2017-06-15T21:38:12Z","snapshot_observed_at":"2026-08-04T14:30:44.904839Z","submitted_at":"2017-06-15T21:38:12Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","version":1},"cited_work":{"arxiv_id":"1706.05098","doi":"10.48550/arxiv.1706.05098","metadata_source":"pith","pith_arxiv_id":"1706.05098","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","venue":"cs.LG","work_id":"2c849184-06ce-40df-8143-ec29eb925f39","year":2017},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/1706.05098","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:fd8145287e87e14fd52d6cf332161ae417563b865a9a7cfb42b17779adffc06b","observation_id":"a2b6b703-6c2c-41d4-8848-295f1e74aada","resolution":{"observed_at":"2026-07-08T02:44:28.042808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:50:59.119295+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:50:59.119295+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.096931Z","title":"Gradient Surgery for Multi-Task Learning , url =","venue":null,"work_id":"fee82168-42eb-435b-bb12-44db24630cdc","year":null},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:668c5367813f5c5df4f659ae60c8971fb730354071202478b3f2db6b568ff645","observation_id":"675b3f63-32f4-4cb4-8d80-7e9f420941f0","resolution":{"observed_at":"2026-07-08T02:54:28.098540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.081222Z","title":"Multi-Task Learning as Multi-Objective Optimization , url =","venue":null,"work_id":"ac4abb0a-e8bc-461b-8ef9-323226c029b1","year":null},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:c4265bbe2e3f85c377be88eaddcba9df58db61e1a42a5592fa9cea07ea925115","observation_id":"e69da6f3-542d-4795-851c-c07896143261","resolution":{"observed_at":"2026-07-08T02:54:28.083081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.328840","doi":"10.1109/taslp.2023.3288409","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing doi:10.1109/TASLP.2023.3288409","venue":"IEEE/ACM Transactions on Audio Speech and Language Processing","work_id":"5d7a3278-672f-4f7f-8ed8-a6c99bf69621","year":2023},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:a795e3c4885bacf806d56a64bd5f0b8d004209c675a41990c910f8ce6dda2c11","observation_id":"6ee3558d-3725-4947-9bda-7b5a391c0bed","resolution":{"observed_at":"2026-07-08T02:44:27.561523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:55.452963+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:55.452963+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.075077Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers , year=","venue":null,"work_id":"f9b7f363-853b-4b0b-90a1-c3fd335631bc","year":null},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:3214929a9df950c100523a6fea8c90b597498b371afa662ed894cef82175b6ae","observation_id":"26063020-15b3-47ca-b4b9-faff0bc7cab5","resolution":{"observed_at":"2026-07-08T02:54:28.076868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.312999","doi":"10.1109/taslp.2021.3129994","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soundstream: An end-to-end neural audio codec","venue":"IEEE/ACM Transactions on Audio Speech and Language Processing","work_id":"fb74ddf3-428a-41a7-b727-4afa47e97f60","year":2022},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:089c518a9d10b6fce016ec1a9a65bf81e80bfe3b4037d5fab394dfb43b8e74fa","observation_id":"c95ab5c7-faf9-4d64-b2b1-ffb71d148c30","resolution":{"observed_at":"2026-07-08T02:44:27.550416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:55.928976+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:55.928976+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.327515","doi":"10.1109/tpami.2023.3275156","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal learning with transformers: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(10):12113–12132","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"0e554914-0751-440d-b412-bf7e4ed61b8f","year":2023},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:98f0a4213ccc9412c67b5d451e37e2b26e7ecd20fd79da34b32bf7655f9ff365","observation_id":"28f62edc-ae10-41d3-aa1e-bfadcb7062b9","resolution":{"observed_at":"2026-07-08T02:44:27.556602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:56.478133+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:56.478133+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1023/a:1007379606734","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:44:27.516737Z","title":"Damien Ernst, Pierre Geurts, and Louis Wehenkel","venue":"Machine Learning","work_id":"4cb0ce88-187f-4820-8e5c-d015cb2dc503","year":1997},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:20c8aeeb98ce83fad1245b77315e57eb2e2f5fc611cfe6780ddec5a6ccedbfde","observation_id":"b79d7231-c488-45b4-9fe9-827beb811674","resolution":{"observed_at":"2026-07-08T02:44:27.519071Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:56.993161+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:56.993161+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-07-06T18:58:56.504337Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":"2408.05211","doi":"10.48550/arxiv.2408.05211","metadata_source":"pith","pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":"cs.CV","work_id":"09d112e4-10dd-4cc7-88a9-7d53d653ac3a","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:a60b5dbed2c8568fdf319b3e46a2a178d6f2c22415ee958a12d49a74c5729692","observation_id":"2d06a823-eb47-47d0-b9b3-263e1e0e86b9","resolution":{"observed_at":"2026-07-08T02:44:27.583375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.508002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":"2410.11190","doi":"10.48550/arxiv.2410.11190","metadata_source":"pith","pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-omni2: Towards open-source gpt-4o with vision, speech and duplex capabilities","venue":"eess.AS","work_id":"104f05e3-a490-4b69-90dc-68a70e9c5355","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:437d963528c643ce09ff17095d9b8916b5d0064d2363dc9e79c3706c8f28c2fd","observation_id":"59717bf9-801b-4e78-981b-3511d357c519","resolution":{"observed_at":"2026-07-08T02:44:27.591192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:57.862459+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:57.862459+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14145","last_updated":"2026-06-03T23:58:01Z","snapshot_observed_at":"2026-07-06T20:39:28.583884Z","submitted_at":"2025-02-19T23:15:13Z","title":"LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems","version":3},"cited_work":{"arxiv_id":"2502.14145","doi":"10.48550/arxiv.2502.14145","metadata_source":"pith","pith_arxiv_id":"2502.14145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Global-aware Expert","venue":"cs.CL","work_id":"98b11843-afc5-4612-9ec8-233a5321cbfe","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2502.14145","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:1fe27356fc8181eb7913c4f259814eacdd3bd1a6d83913ce5193af22716f236d","observation_id":"64ebfddc-59c9-4709-91aa-d6ae7d164469","resolution":{"observed_at":"2026-07-08T02:44:27.526294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:58.238779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:58.238779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":"2412.02612","doi":"10.48550/arxiv.2412.02612","metadata_source":"pith","pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","venue":"cs.CL","work_id":"1d250ff4-6ca5-4eb5-b561-48106b630d8b","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:16e268ebe47b527e27d9ff724f1479365e183234784174c266d91a93b04422d7","observation_id":"c2226ca2-91bf-4957-b01f-fb74290ba53e","resolution":{"observed_at":"2026-07-08T02:44:27.544716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16327","last_updated":"2025-01-27T18:59:51Z","snapshot_observed_at":"2026-08-04T02:34:31.663455Z","submitted_at":"2025-01-27T18:59:51Z","title":"LUCY: Linguistic Understanding and Control Yielding Early Stage of Her","version":1},"cited_work":{"arxiv_id":"2501.16327","doi":"10.48550/arxiv.2501.16327","metadata_source":"pith","pith_arxiv_id":"2501.16327","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shao, H","venue":"cs.CL","work_id":"a9e367ab-e3cd-4f74-85e0-90a83a931104","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2501.16327","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:1f375168b46317f66a18a709dfcbbe12faaf1739765819e9ec50b4ab1f26a174","observation_id":"692fd470-4a4a-4250-a939-0a77615a0aac","resolution":{"observed_at":"2026-07-08T02:44:27.522952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:59.036717+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:59.036717+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T06:59:42.014291Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":0,"verified_exact":30,"verified_fuzzy":16},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.06540."}