{"as_of":"2026-08-12T23:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1495fe52df0e6572dc8369442aad8ff89816dd8c79a8c06763733c1f27c95590","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:11:43.731582Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:11:43.564832Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T15:11:44.295858Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"cited_work":{"arxiv_id":"2608.10878","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.10878","snapshot_observed_at":"2026-08-12T15:11:44.295858Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","venue":"cs.CL","work_id":"3a767656-250a-4429-bd7d-54c74c9eee9f","year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.564832Z"},"links":{"cited_paper":"/paper/2608.10878","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:56d0858b1bf583037f90dc9b7f163c51d9184b074c7c095029a4033a3dedc50a","observation_id":"bc457826-56a3-4a4b-8ed3-9aa7ee5d3c48","resolution":{"observed_at":"2026-08-12T15:11:44.300966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.10878/citation-record","integrity":"/paper/2608.10878/integrity","json":"/paper/2608.10878/citation-record.json","paper":"/paper/2608.10878"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.608739Z","title":"To manage these complex conversational dynamics, a responsive system must continuously estimate fine-grained turn states","venue":null,"work_id":"c593841a-c9eb-435c-9725-fb7ada9ca9a2","year":null},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.549766Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:4b150fea1eccd90ff46cf577651eefdcd5937a94710db0a2308c00b9795d4e74","observation_id":"243e76be-3a72-4c4d-ad9e-7d712b096dfe","resolution":{"observed_at":"2026-08-12T15:11:44.614557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.591671Z","title":null,"venue":null,"work_id":"afa9a841-379c-413c-a223-b7217ded8914","year":null},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.555407Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:9a6511529263d68c96a38911622d747202b0a02562cfd8b3db080843581cc30f","observation_id":"9ee589f8-f928-496a-8c0b-be97d9d7ed30","resolution":{"observed_at":"2026-08-12T15:11:44.597022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.572980Z","title":"We further introduce an ASR-anchored supervision method that projects word-level turn annotations onto the frame-level ASR token timeline","venue":null,"work_id":"c13b56f3-fd73-4c59-92b6-7f3ff14f6a09","year":null},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.559896Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:ef4833a2cded1e34d4ac0e4332e8856c27803d57cb6210f5fcbb304fd7834f33","observation_id":"55cf7189-d921-4510-9de8-1e226fe42d8b","resolution":{"observed_at":"2026-08-12T15:11:44.578653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"cited_work":{"arxiv_id":"2608.10878","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.10878","snapshot_observed_at":"2026-08-12T15:11:44.295858Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","venue":"cs.CL","work_id":"3a767656-250a-4429-bd7d-54c74c9eee9f","year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.564832Z"},"links":{"cited_paper":"/paper/2608.10878","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:56d0858b1bf583037f90dc9b7f163c51d9184b074c7c095029a4033a3dedc50a","observation_id":"bc457826-56a3-4a4b-8ed3-9aa7ee5d3c48","resolution":{"observed_at":"2026-08-12T15:11:44.300966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.556750Z","title":"um”, “ah","venue":null,"work_id":"6168adc1-3648-473b-a574-82a7037498b9","year":null},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.570788Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:85049e9665e0128d25e2ac722441c417324b67a4c0ac0986d478a316413c00ba","observation_id":"c6d0c0a1-80ff-4cf2-9700-f4d23e32a6b6","resolution":{"observed_at":"2026-08-12T15:11:44.561641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.541531Z","title":"Data Preparation The corpora used in this work consist of two parts: Chinese- English ASR data and turn-taking data","venue":null,"work_id":"b5b94e9d-03ff-4825-87f1-6d4c53f92de2","year":null},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.576540Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:9ac3dd2773b2ab3e923ee083eeac63f8c8b776ae47ef1867b930b94d338230f5","observation_id":"f57329ae-9658-4038-85ad-655f281767ec","resolution":{"observed_at":"2026-08-12T15:11:44.546774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.526369Z","title":null,"venue":null,"work_id":"2514ff3c-6664-41f4-bba8-a7752f848c1b","year":null},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.581668Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:6f7dea6eb33e9fe580dec331ba125c8b37b2e83ef26eb0874795600f3657b51b","observation_id":"71c5d73c-f4b7-40dc-9aa6-1d38384316e0","resolution":{"observed_at":"2026-08-12T15:11:44.531109Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.510808Z","title":null,"venue":null,"work_id":"7207669b-2138-489a-b9b2-867e38b44bce","year":null},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.586925Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:d20d63950f7fba2bfb14461864b5ea225ad2d5931e4b96325da6e26b7a7c4456","observation_id":"60c7699a-dfa3-44d8-aedc-da5b7668c61d","resolution":{"observed_at":"2026-08-12T15:11:44.515454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.591372Z","title":"Turn-taking in conversational systems and human- robot interaction: a review,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.591372Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:4f49c09718481a43cbe2427bdb72bd7e879a3453aec74740e7f01db0f4357725","observation_id":"b0516a04-94dd-4295-91eb-881aa7fb50ef","resolution":{"observed_at":"2026-08-12T15:11:43.591372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.595818Z","title":"Generative spoken dialogue language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.595818Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:cafad81e35e52e1abe5a1a06a8d13cfeb7fbe4f6851792ce4de65f5831302074","observation_id":"fb58300e-019c-450b-980c-0d6af1b55519","resolution":{"observed_at":"2026-08-12T15:11:43.595818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-12T15:11:43.600630Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.600630Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:e58a6ccddef280ab051c8408cdd98e0b0f3169fcfd566692b9ad802c5672d8e5","observation_id":"8c42fa91-5938-4548-9fdb-cca45f2b2dd5","resolution":{"observed_at":"2026-08-12T15:11:43.600630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.474167Z","title":"Freeze-omni: A smart and low latency speech- to-speech dialogue model with frozen LLM,","venue":null,"work_id":"06c4702d-6172-472f-aab8-3916971dcc1c","year":2025},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.605914Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:af28273fa74c94a7dc2979f7ee75f17155d246e0c290370a2b36d91fb10e54fc","observation_id":"ccfff85c-d97c-4da1-b2b7-fa3fe2311594","resolution":{"observed_at":"2026-08-12T15:11:44.479011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.458068Z","title":"Omniflatten: An end-to- end gpt model for seamless voice conversation,","venue":null,"work_id":"efa70952-8b7e-4bf7-b602-c100401d5c5f","year":2025},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.610969Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:3fb0b29734e10d93c10f2dff9200486cce09d9b01af1d0acabba1d31ce7e4702","observation_id":"1ddfa5ec-f00b-4023-b058-9dfe69d2a306","resolution":{"observed_at":"2026-08-12T15:11:44.462822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.443019Z","title":"Personaplex: V oice and role control for full duplex conversational speech models,","venue":null,"work_id":"482c3cc9-1e91-483d-bcc5-10826593ae7b","year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.616181Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:27fc2047fe7438722226dacda73e25ff429ffe0f44caac8a7a8737eac0b1bb3a","observation_id":"73769c5b-084b-41e4-b6f0-0323e246d9c8","resolution":{"observed_at":"2026-08-12T15:11:44.447867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13472","last_updated":"2025-05-29T03:32:21Z","snapshot_observed_at":"2026-08-08T15:44:10.934917Z","submitted_at":"2025-02-19T06:51:34Z","title":"FlexDuo: A Pluggable System for Enabling Full-Duplex Capabilities in Speech Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13472","snapshot_observed_at":"2026-08-12T15:11:43.620558Z","title":"Flexduo: A pluggable system for enabling full- duplex capabilities in speech dialogue systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.620558Z"},"links":{"cited_paper":"/paper/2502.13472","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:6add2981b4cb97828cbd3378c41f53fca2e249b92d2ec7a9f3a48fc3b02bb1d2","observation_id":"c20728d0-e494-4e2f-9e3e-4cf15a49ae8f","resolution":{"observed_at":"2026-08-12T15:11:43.620558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.427551Z","title":"Easy turn: Integrating acoustic and lin- guistic modalities for robust turn-taking in full-duplex spoken di- alogue systems,","venue":null,"work_id":"6c189e1c-2c9c-49d6-953e-14153899c0a3","year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.625434Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:f45b5364777c1725d9879cc5e73605a03c87315dc6338182c821c7172697907f","observation_id":"c80814d9-981f-454c-8bca-679051c1e60a","resolution":{"observed_at":"2026-08-12T15:11:44.432904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.26515","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.237792Z","title":"Jal-turn: Joint acoustic- linguistic modeling for real-time and robust turn-taking detec- tion in full-duplex spoken dialogue systems,","venue":null,"work_id":"1c0afa47-28b8-4bdb-ba05-7375b4f28a5a","year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.629922Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:9002d86831ab3b2c852954d7dc4efc708aecae7dbc340d0ef611102ddf19e8ce","observation_id":"42074b39-6486-459c-83bc-53b24969deee","resolution":{"observed_at":"2026-08-12T15:11:44.247796Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.01897","snapshot_observed_at":"2026-08-12T15:11:43.634685Z","title":"Fastturn: Unifying acoustic and streaming semantic cues for low-latency and robust turn detection,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.634685Z"},"links":{"cited_paper":"/paper/2604.01897","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:7f927f810cf5b0a1e51b5549680367def8e613a4908cd84d5ca5081a44c50034","observation_id":"0cf32aa9-be7d-4cf8-af2a-3e44d287ce5f","resolution":{"observed_at":"2026-08-12T15:11:43.634685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.639915Z","title":"Soulx-duplug: Plug-and-play streaming state prediction module for realtime full-duplex speech conversa- tion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.639915Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:52e5db99061918372fcf2550b954b7daa2c0049621c6a6cbc0971f0690ed0a4c","observation_id":"3eca560f-6b46-4e2f-99b5-487220562900","resolution":{"observed_at":"2026-08-12T15:11:43.639915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"cited_work":{"arxiv_id":"2608.01119","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.01119","snapshot_observed_at":"2026-08-12T15:11:44.072545Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","venue":"cs.SD","work_id":"cc9b145c-170f-49dc-a737-9bd6699cfc28","year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.644343Z"},"links":{"cited_paper":"/paper/2608.01119","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:ffd713e57e8a18505cd9051b8e281529ae4eca7f2871d196a9d6c6c53fecc904","observation_id":"243f96e7-1fbd-4806-b777-5f82cac80473","resolution":{"observed_at":"2026-08-12T15:11:44.080022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.411706Z","title":"Ten vad: A low-latency, lightweight and high- performance streaming voice activity detector (vad),","venue":null,"work_id":"20208992-e542-4bfd-9ec9-8e36516a92f6","year":2025},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.648947Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:1fb2785a37ed55f0c5f07846db7fccbd8b68a8f50e3369bf57ac08938d75b1d6","observation_id":"8c5eb925-300a-4967-acd2-433b8b597dd7","resolution":{"observed_at":"2026-08-12T15:11:44.416760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.654024Z","title":"Streaming sequence-to-sequence learning with de- layed streams modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.654024Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:4dc25a8887e4e4b3e8d5c9647146bbcf570d826a6f5e647defaa91c606070b22","observation_id":"2a9f1f8d-b2f3-4025-ac78-40e7dbc7ccb7","resolution":{"observed_at":"2026-08-12T15:11:43.654024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11298","last_updated":"2026-04-06T15:18:26Z","snapshot_observed_at":"2026-08-12T18:59:47.656993Z","submitted_at":"2026-02-11T19:17:10Z","title":"Voxtral Realtime","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11298","snapshot_observed_at":"2026-08-12T15:11:43.658756Z","title":"V oxtral realtime,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.658756Z"},"links":{"cited_paper":"/paper/2602.11298","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:e81df3a1b8eff8df25362abf950469f8e2d09a4b06c5d02aba46aa3c03787f2b","observation_id":"cf394a1b-408c-4254-8f19-e4753b0c1cc6","resolution":{"observed_at":"2026-08-12T15:11:43.658756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-12T15:11:43.664098Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.664098Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:a7fd1671561c1bbaef091c8abd96ff358084dfd0396d0f818eb5886a823f616c","observation_id":"2768a0fb-beb0-4816-a52e-8449723d3e61","resolution":{"observed_at":"2026-08-12T15:11:43.664098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.669914Z","title":"Aishell-1: An open- source mandarin speech corpus and a speech recognition base- line,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.669914Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:d6a5be63f7ee73685aa34c6ff32b08386a697734e10723d3547bc2cd963bb273","observation_id":"f16645d1-d41e-4ab4-bd14-0491269f89fa","resolution":{"observed_at":"2026-08-12T15:11:43.669914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-08-10T01:59:34.520388Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-08-12T15:11:43.674457Z","title":"Aishell-2: Transform- ing mandarin asr research into industrial scale,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.674457Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:543cecbe31f7417745344d4425675bc8403f394161ef888b548a0e742c2829e0","observation_id":"03782fa7-f34c-43d2-9d32-8f65f8743333","resolution":{"observed_at":"2026-08-12T15:11:43.674457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-11T16:25:21.518432Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-12T15:11:43.679417Z","title":"Aishell-3: A multi- speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.679417Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:a5669c438efcfe1a17ae2df96b6b362b17123903b5917902fae1d9a703589f11","observation_id":"d0303442-e53b-4903-88a3-74435f2c5e76","resolution":{"observed_at":"2026-08-12T15:11:43.679417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03603","last_updated":"2021-08-10T09:15:00Z","snapshot_observed_at":"2026-07-06T10:57:34.353038Z","submitted_at":"2021-04-08T08:38:44Z","title":"AISHELL-4: An Open Source Dataset for Speech Enhancement, Separation, Recognition and Speaker Diarization in Conference Scenario","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03603","snapshot_observed_at":"2026-08-12T15:11:43.684284Z","title":"Aishell-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.684284Z"},"links":{"cited_paper":"/paper/2104.03603","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:5c5da2e4d1a8930f50bb6df45678f8066e9af83e865e98c79418ff2afc203b58","observation_id":"db800827-8d9f-4ee6-b3e0-33b6c1d05d4e","resolution":{"observed_at":"2026-08-12T15:11:43.684284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.689721Z","title":"M2met: The icassp 2022 multi- channel multi-party meeting transcription challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.689721Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:a244a9aed8eeba37cbc9d50ac86a98ce18c1b170158f25d56f2aa57004bd3398","observation_id":"db1c7181-a875-4722-9b7e-d790bb662aaf","resolution":{"observed_at":"2026-08-12T15:11:43.689721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.373388Z","title":"Wenetspeech: A 10000+ hours multi- domain mandarin corpus for speech recognition,","venue":null,"work_id":"dc3e1733-57bc-4024-9b11-d2ba45b6f2bd","year":2022},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.694583Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:37b8c874268c89f3645126786ac21f7a029c3cad10f0c615713fc080fa74981c","observation_id":"03e80c0f-56db-4b13-92b2-fa4ded69fe44","resolution":{"observed_at":"2026-08-12T15:11:44.379233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.357473Z","title":"Kespeech: An open source speech dataset of mandarin and its eight subdialects,","venue":null,"work_id":"5f95c6a6-4f62-4ef7-9e79-06239d39e511","year":2021},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.698968Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:0354f09579d20bd4686fc1bbf8cda83daced44e5ae01bc568640f594aae0989d","observation_id":"5570088e-3a19-4197-9277-ab3ef34074e6","resolution":{"observed_at":"2026-08-12T15:11:44.362696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.703973Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.703973Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:8f9b34a5b4642282f9a2477a710c6666e475977702c87cf5c0c89406327b84d3","observation_id":"3936bbef-1e34-4374-8050-28cb2e91a93b","resolution":{"observed_at":"2026-08-12T15:11:43.703973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-12T15:11:43.708566Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.708566Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:b20026cc12fa7fec1da6e32f0cfddd992e630bea20ec24545b1bb1c3933886e4","observation_id":"d21430d1-f07b-4d58-b5af-fc516e071a1f","resolution":{"observed_at":"2026-08-12T15:11:43.708566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:44.331163Z","title":"Ted-lium 3: Twice as much data and corpus repartition for experiments on speaker adaptation,","venue":null,"work_id":"59bbd6bf-63f5-46bf-b6d5-35a2e45f0d7d","year":2018},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.713416Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:c851eb07effb214b97b84dd69aabcada30c6ccc8e37958e1fa378e2a97cc5fec","observation_id":"ce8a115d-a805-40cb-9c65-b5096ae28c3e","resolution":{"observed_at":"2026-08-12T15:11:44.336181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.717739Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.717739Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:58c8bf583e58a99b1c4d94697399bfc5053c0c63b8ba7bc2231a236bc6adea9f","observation_id":"fe48ccfb-ced6-4a36-87a6-b802d8e87c82","resolution":{"observed_at":"2026-08-12T15:11:43.717739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.722161Z","title":"The fisher corpus: A resource for the next generations of speech-to-text","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.722161Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:72459defa67a63c1eee63471dad3ad911bf0b3eb56ad3093a2115c6c1e3a2844","observation_id":"67cefe6a-0142-42b6-9bc1-041ff6ddc039","resolution":{"observed_at":"2026-08-12T15:11:43.722161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-12T15:11:43.726618Z","title":"Qwen3-asr technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.726618Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:f48ea41642ba0a4e9d4a1d9ed7dde190a383f11b09e321e65725949065aed4f7","observation_id":"57b29c58-0dd6-4172-b7a0-775e9bc71efb","resolution":{"observed_at":"2026-08-12T15:11:43.726618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:11:43.731582Z","title":"Uni-asr: Unified llm-based architecture for non-streaming and streaming automatic speech recognition,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:43.731582Z"},"links":{"citing_paper":"/paper/2608.10878"},"observation_digest":"sha256:9030eedecefa47ded310d04029a9d18da89bd80389056dc37494db72802adc51","observation_id":"3a837235-4f00-4319-9986-02d2c942490b","resolution":{"observed_at":"2026-08-12T15:11:43.731582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10878","last_updated":"2026-08-11T12:54:52Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T23:27:08.303531Z","submitted_at":"2026-08-11T12:54:52Z","title":"X2-Turn: Frame-Synchronous Dual-Head Modeling for Joint Streaming ASR and Turn State Prediction"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":12},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2608.10878."}