{"as_of":"2026-08-08T04:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:256cf208806e1d260d02d08a74d3b48af3c5270b070696ed1f410d32f5587b75","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:47:14.172217Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T05:37:17.684884Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:28:39.127928Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"cited_work":{"arxiv_id":"2506.07081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07081","snapshot_observed_at":"2026-07-03T16:28:39.127928Z","title":"Streaming endpointer for spoken dialogue using neural audio codecs and label-delayed training,","venue":null,"work_id":"b678b14b-c2f1-49b8-b748-379950175030","year":2025},"citing_paper":{"arxiv_id":"2606.13450","last_updated":"2026-06-11T15:09:45Z","snapshot_observed_at":"2026-08-07T20:54:58.764446Z","submitted_at":"2026-06-11T15:09:45Z","title":"Endpoint Anticipation for Low-Latency Spoken Dialogue","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T05:37:17.684884Z"},"links":{"cited_paper":"/paper/2506.07081","citing_paper":"/paper/2606.13450"},"observation_digest":"sha256:e55fb13809568e09522bac8ba2da60130cb2cc2736b2cd0f801ed002e154c685","observation_id":"1f8ee3e4-80fe-4a9d-bb4c-5c66b4c1ee93","resolution":{"observed_at":"2026-07-03T16:28:39.129488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07081/citation-record","integrity":"/paper/2506.07081/integrity","json":"/paper/2506.07081/citation-record.json","paper":"/paper/2506.07081"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T05:47:11.320572Z","title":"WavChat: A Survey of Spoken Dialogue Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.320572Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:0827e12e6a86f3a943e2c9c8a6f203ac9c39bc8139a12700d1b29339556aa97f","observation_id":"44080555-c607-49e4-a760-a70df34c9de0","resolution":{"observed_at":"2026-08-07T05:47:11.320572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.901446Z","title":"A review of subjective scales measuring the user experience of voice assistants,","venue":null,"work_id":"00f9dc16-c0f0-4f79-8614-8918f2f2619f","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.409467Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:d4f544da19be01d5b632ba104215bf59d9cf1fa42b2b3d7e07bdfcdf06a7e27d","observation_id":"1ca75ee5-98f1-49b8-9bce-9eed04c1a35a","resolution":{"observed_at":"2026-08-07T05:47:19.964681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:47:11.481844Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.481844Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:3e7b6baf33e78cfec9fe00b43b963e35afac680cd3df6a305e70daedd12284c0","observation_id":"54c688bf-1a8f-4aa7-8334-91adfada3c3c","resolution":{"observed_at":"2026-08-07T05:47:11.481844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.748290Z","title":"OpenAI-gpt-4o,","venue":null,"work_id":"01759794-3f22-464d-9c38-693ffec4ce21","year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.526889Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:89778a8ecd0b14a1e9fc348c0da73d3b310351b683f78ae864087731ae17159a","observation_id":"0f0da420-5713-49ff-9605-d978e32a8c85","resolution":{"observed_at":"2026-08-07T05:47:19.794138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.625100Z","title":"Improved End- of-Query Detection for Streaming Speech Recognition,","venue":null,"work_id":"bda23181-c699-486c-abed-4bb86ba321ad","year":2017},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.656767Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:d3381f793f7390fa37904606281f175ebb5b72e6549cee74edecc02a7371b43f","observation_id":"261a5a25-60ab-49de-b987-497f08b38a76","resolution":{"observed_at":"2026-08-07T05:47:19.682409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.466778Z","title":"V oice activity projection: Self-supervised learning of turn-taking events,","venue":null,"work_id":"9f8f0f17-ac94-4a9e-8603-6b3605ff5a61","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.711258Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:c92cdb3d8660b81acf06783e594d3b789ab706a3ade78aa2e791591032a1f2a4","observation_id":"be2a5081-a9d9-4e68-9d62-720bfb6fda20","resolution":{"observed_at":"2026-08-07T05:47:19.539409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.328977Z","title":"Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics ,","venue":null,"work_id":"ef988107-5d59-449a-981f-a3d6b70647c0","year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.779580Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:9de286103367fda2aa29516bd2a61565fdf481713950921af7e8e53fd4058b00","observation_id":"651c22f7-0f2f-4f6f-842d-169ef6f7cf64","resolution":{"observed_at":"2026-08-07T05:47:19.396827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.186213Z","title":"Root causes of lost time and user stress in a simple dialog system,","venue":null,"work_id":"030f6af2-36da-4548-a3ad-0d8e68e29703","year":2005},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.855592Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:c5c8da299ccb5fa9c75e251bdd75f9f6e93d5761d3807ff89295278060173c36","observation_id":"bf9ee3b0-9255-4331-84b8-4392ca4b0ce8","resolution":{"observed_at":"2026-08-07T05:47:19.274468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:19.041070Z","title":"A statistical model-based voice activity detection,","venue":null,"work_id":"d62b8b59-c0cf-454b-94c2-2614c9eaee43","year":1999},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.946892Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:80ee5cf40bd0cc24e789885b3d4eb45ff43ccd403a53a4526bc4c95484ed6ab1","observation_id":"96915e7a-187b-4b5b-b6f9-52620342af30","resolution":{"observed_at":"2026-08-07T05:47:19.096855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.885244Z","title":"A Convolutional Neural Network Smartphone App for Real-Time V oice Activity Detection,","venue":null,"work_id":"84438af8-9e12-4425-90a7-3551e8a60181","year":2018},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.001979Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:471f52a771405ca9bac122801d880f033a3f83987f0863c421bdd8d0b595a368","observation_id":"1f4f2787-25e3-4410-b0d1-4d46fba5cc3d","resolution":{"observed_at":"2026-08-07T05:47:18.965610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.699160Z","title":"Temporal modeling using dilated convolution and gating for voice-activity-detection,","venue":null,"work_id":"341caf2f-137b-44f9-b7ec-bf33761907a5","year":2018},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.092752Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:2086cdc44d4629fabf57e2e24121fa363abb2c0cea1b719792312766e9e3cb2d","observation_id":"b96e219c-d423-4ddf-9bd5-d3b65f4c9073","resolution":{"observed_at":"2026-08-07T05:47:18.753204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.557842Z","title":"Robust end-of-utterance detection for real-time speech recognition applications,","venue":null,"work_id":"e38b7fa4-6d4e-41f1-a50f-202a8149556f","year":2001},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.157555Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:7ef518b74c2a4188471f4a2c8893fee7e8337ff26ba245185102d4ae6b3f7101","observation_id":"7ad4af9c-0153-444c-8f67-863e23fd20bd","resolution":{"observed_at":"2026-08-07T05:47:18.629364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.387355Z","title":"Combining acoustic embeddings and decoding features for end-of-utterance detection in real-time far-field speech recognition systems,","venue":null,"work_id":"5548b1cc-3a7d-4291-9e46-abc05976253a","year":2018},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.248057Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:e580c4fd28f5277543bd98f96e3feb7aaa77d78cd857c8d88c3a76bab2294d73","observation_id":"f50f5b3e-03d1-4f6b-8d10-1ec217bbbdf2","resolution":{"observed_at":"2026-08-07T05:47:18.503583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.244971Z","title":"Dynamic speech endpoint detection with regression targets,","venue":null,"work_id":"b174cb09-2278-461f-8b33-377347713226","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.341985Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:2f4511aaa440afe6853ef5932423cec5a545a48d34c716e92e67704473e97db2","observation_id":"5dc9aed4-5c79-4292-830b-050f5772222d","resolution":{"observed_at":"2026-08-07T05:47:18.308518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:18.049355Z","title":"SoundStream: An End-to-End Neural Audio Codec,","venue":null,"work_id":"1c470453-aaab-402e-8494-82ad8c8bff6d","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.410195Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:046b96a7d967d18c69e22e048383096062ab94b83815ed32d5217c0931ae8bd4","observation_id":"b86fa938-e980-45c9-a34f-227472dbd7e5","resolution":{"observed_at":"2026-08-07T05:47:18.141871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.911058Z","title":"High Fidelity Neural Audio Compression,","venue":null,"work_id":"f87de819-73cb-4398-9c00-d7cc8c46a0d3","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.520620Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:3b85ca6f00d3c1ab85b1ea854746f9082f1724dfed9360a871be316f5fc6a5e9","observation_id":"34bd2dc7-2de0-4b9d-a23b-3ffbca6bbfe4","resolution":{"observed_at":"2026-08-07T05:47:17.978334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.722841Z","title":"Audiodec: An Open-Source Streaming High-Fidelity Neural Audio Codec,","venue":null,"work_id":"4ac5efdc-d987-4e7f-8da0-72a216e0caf4","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.585964Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:bd1be78e19a238d15b79b33872aed7bdaa43fa3f8d3cb4f335cc0f5f0c3dfb12","observation_id":"17e1c7d0-bc0f-4cfc-81f8-2d25bb286c4e","resolution":{"observed_at":"2026-08-07T05:47:17.830311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T05:47:12.652698Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.652698Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:2073480b2081cfaf62d0a48a137d2166d814c5061cbbfd6395f5dd4485e2e608","observation_id":"9d41f697-b6d7-4954-95f6-dc506c121022","resolution":{"observed_at":"2026-08-07T05:47:12.652698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.556038Z","title":"Codec-SUPERB: An In-Depth Analysis of Sound Codec Models,","venue":null,"work_id":"8d4ab7f2-1c1d-4b00-b5d9-0772ad2468a7","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.704887Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:48f84241d537af4817cb29de005656a806ed0b28738934fbc00f9f3c284b2db1","observation_id":"a363b232-9cb9-456b-9fd4-f460d74c6255","resolution":{"observed_at":"2026-08-07T05:47:17.616111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15897","last_updated":"2025-02-24T18:34:41Z","snapshot_observed_at":"2026-07-06T19:21:03.775247Z","submitted_at":"2024-09-24T09:16:11Z","title":"ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech","version":2},"cited_work":{"arxiv_id":"2409.15897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15897","snapshot_observed_at":"2026-08-07T05:47:14.348285Z","title":"ESPnet-Codec: Comprehensive Training and Evaluation of Neural Codecs for Audio, Music, and Speech","venue":"eess.AS","work_id":"9a63511b-6dcb-4119-aabe-067e438be83d","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.794875Z"},"links":{"cited_paper":"/paper/2409.15897","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:61edbfd6e9c3038d754816a9b11dd8f37b37d6b359904cadec645da1c57a3004","observation_id":"6595c748-2f80-4c2f-b947-401edb609c36","resolution":{"observed_at":"2026-08-07T05:47:14.407787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.374186Z","title":"Codec-ASR: Training Performant Automatic Speech Recognition Systems with Discrete Speech Representations,","venue":null,"work_id":"0fa7dd06-d2e6-41f1-a7fb-a7d7d4313bc8","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.857921Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:4b168642b841bf4aa6d2ef2226990f58e7cf0d7f4bb69548e4cfbdc4480f5c83","observation_id":"eae1316f-4479-4d94-9707-99e0bbf49b08","resolution":{"observed_at":"2026-08-07T05:47:17.453168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03382","last_updated":"2025-02-26T09:31:58Z","snapshot_observed_at":"2026-08-07T11:17:00.922804Z","submitted_at":"2025-02-05T17:18:55Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03382","snapshot_observed_at":"2026-08-07T05:47:12.941618Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:12.941618Z"},"links":{"cited_paper":"/paper/2502.03382","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:93dd663f91e66116bfd92eaf1b82107c010cc8eee886bcd80c9cf42262980c0d","observation_id":"9893ded1-943e-47cd-b054-faab046ad98c","resolution":{"observed_at":"2026-08-07T05:47:12.941618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:13.003105Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.003105Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:6cef9aac1e4fdf45d8ae96bf0f34c6cd6ddf1fe333462f4b48d661fdf1cf96df","observation_id":"63e01f50-c2ee-408e-a658-eb4bf3d9617c","resolution":{"observed_at":"2026-08-07T05:47:13.003105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04752","last_updated":"2024-09-24T07:40:54Z","snapshot_observed_at":"2026-08-07T10:24:00.028290Z","submitted_at":"2024-05-08T01:40:13Z","title":"HILCodec: High-Fidelity and Lightweight Neural Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04752","snapshot_observed_at":"2026-08-07T05:47:13.130003Z","title":"Hilcodec: High fidelity and lightweight neural audio codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.130003Z"},"links":{"cited_paper":"/paper/2405.04752","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:70d6f66621d039f2961fd5512fae752b20e1ffc1fdca1012eae2972d241cd884","observation_id":"6a621974-0784-420e-8bea-cabd6897ef01","resolution":{"observed_at":"2026-08-07T05:47:13.130003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.226496Z","title":"End-to-end speech endpoint detection utilizing acoustic and language modeling knowledge for online low- latency speech recognition,","venue":null,"work_id":"5e81c237-18f2-4e67-a46e-43597ab05fa8","year":2020},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.214580Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:77543784c95017a5cb84c23826b179e37ea2ab2b4ea0798720298566121814eb","observation_id":"abbbbc0c-103e-4429-a95f-dbb4fbdbbd95","resolution":{"observed_at":"2026-08-07T05:47:17.289254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:17.096028Z","title":"Joint endpointing and decoding with end-to-end models,","venue":null,"work_id":"61be9bd8-44e7-4ed0-8a2a-45f183ba6133","year":2019},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.254678Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:74d724d57abe19e544ca62464a1441ea6193827e38b2c5dc4dd413f87beef297","observation_id":"d98b2206-b1c5-4486-9f80-464af49ccf38","resolution":{"observed_at":"2026-08-07T05:47:17.150228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.931376Z","title":"Turn-Taking Prediction for Natural Conversational Speech,","venue":null,"work_id":"c045e9ec-aade-4d1b-8288-d09349e494a8","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.295077Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:4a8160f2bccee8e1f30f7e5ca41948ce2365a349fb9af497194d691f8ab25df1","observation_id":"4344bebb-23e6-4ca9-83c1-9f4ab23c83a8","resolution":{"observed_at":"2026-08-07T05:47:16.992507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.797880Z","title":"Towards fast and accurate streaming end-to-end ASR,","venue":null,"work_id":"d24b65c2-6caf-4458-9707-4a8571186d1e","year":2020},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.378298Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:6fbbebbd12e7cefe74b118a6a5895ff079870f60eab70f98defc1217bec100c6","observation_id":"1aad363c-8c0b-479f-872f-b23e539ee1a3","resolution":{"observed_at":"2026-08-07T05:47:16.879748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.676735Z","title":"Streaming Automatic Speech Recognition with Re-blocking Processing Based on Integrated V oice Activity Detection","venue":null,"work_id":"c7d1ce55-8c2d-4412-9f31-aaea8116df36","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.441465Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:0391939e59e568a841dba62df017341d9872144e2b676b8a2007d23dfe1a653a","observation_id":"30dea1f6-734e-4b63-899a-fcc8d19ed347","resolution":{"observed_at":"2026-08-07T05:47:16.705567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.566948Z","title":"Two-Pass Endpoint Detection for Speech Recognition,","venue":null,"work_id":"d830338c-77c4-4b31-8575-6a5ff46ead11","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.504091Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:822e06387c984b6f4fd96af781fa0f6bd8dd1ac02af84f85a101c23697307487","observation_id":"b5881084-3c11-4493-bfc4-749fdef1cbd7","resolution":{"observed_at":"2026-08-07T05:47:16.631628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.388362Z","title":"Towards Accurate and Real-Time End-of-Speech Estimation,","venue":null,"work_id":"434406b0-1b11-4105-a8a0-15ef19e43f2b","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.535657Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:08ae1c80a1c8e21e2d9ea5b0e0aae115524b52ed8332737e7b3a5fa90b4efc40","observation_id":"f50655af-451a-4b4e-9481-990a3529c45f","resolution":{"observed_at":"2026-08-07T05:47:16.506542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.200907Z","title":"Text Injec- tion for Capitalization and Turn-Taking Prediction in Speech Models,","venue":null,"work_id":"0250c80d-d24e-4028-aab7-ee8b22d39b04","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.576137Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:7a899cd8824d8628c63e3bcba63f37ae2458dd30621a526aa6f985885d0ae1dc","observation_id":"473084b1-adfe-47ea-87a7-353b44ab619d","resolution":{"observed_at":"2026-08-07T05:47:16.264732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:16.009334Z","title":"Multilingual turn-taking prediction using voice activity projection,","venue":null,"work_id":"032dfcf8-e986-49ff-b8c8-648f4d780b41","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.643938Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:5163ad0f33d582adb55cf9f31a5d29e5d118c80259b37b089fe768894d087db5","observation_id":"7e73b4fd-9911-40ce-8881-1abafd2b4420","resolution":{"observed_at":"2026-08-07T05:47:16.112289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.854961Z","title":"Yeah, un, oh: Continuous and real-time backchannel prediction with fine-tuning of voice activity projection,","venue":null,"work_id":"8784019c-73cc-4c02-bf73-bb56045fcdbf","year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.681171Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:22049f7bf6a0bab5b84e63380c9b9395a3aea955b11ad71cdee20fe8445778c8","observation_id":"89e63db1-7533-4c20-be69-3ed56f734810","resolution":{"observed_at":"2026-08-07T05:47:15.914320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.610108Z","title":"Turn-Taking and Backchannel Prediction with Acoustic and Large Language Model Fusion,","venue":null,"work_id":"2f1f648c-090e-470c-8a6e-d56e30369818","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.728539Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:50b243e30f7b2956ba2d4da6619b2dc2b66395d7e79fa252471b473d31aaf739","observation_id":"45cbefc9-f0af-4ab9-b512-200a9d8bfa12","resolution":{"observed_at":"2026-08-07T05:47:15.745811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.457185Z","title":"End-to-end automatic speech recognition integrated with CTC-based voice activity detection,","venue":null,"work_id":"a811db4b-a1ff-4510-b4fc-7144200caa74","year":2020},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.756574Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:8fdbac07d821f4e3610adbb4e57ed0bbbf4bdac79f489b43b2e7b8f15575dad4","observation_id":"9c4f5350-1927-4723-af50-68fd90cd8876","resolution":{"observed_at":"2026-08-07T05:47:15.537482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.264442Z","title":"Text- free prosody-aware generative spoken language modeling,","venue":null,"work_id":"42d23663-33cc-487d-a9ab-9eca5e394509","year":2022},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.809131Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:7cf4c7b89b836e732401a6bf1bd01743fa064ab8936c65fe582382b483d328a8","observation_id":"4debdea7-6324-49e2-aece-de6ddf6788b2","resolution":{"observed_at":"2026-08-07T05:47:15.345486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:15.084652Z","title":"Simple and controllable music generation,","venue":null,"work_id":"599d1838-4ddf-40a0-8a0a-9ac4760881d3","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.835391Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:4eab21855d0fc466c7f78b8a72d705e1d8ba336c44cc829dc69b67d355e07612","observation_id":"dc82655a-cacc-48b4-b0f3-ee6fd9074f98","resolution":{"observed_at":"2026-08-07T05:47:15.129513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:14.975865Z","title":"SpokenWOZ: a large-scale speech-text benchmark for spoken task-oriented dialogue agents,","venue":null,"work_id":"d75d6e72-3774-419a-ac89-1b3cc2aac28c","year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.880359Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:8cf754d7153face6084a0dabf6fa39953e73b6b068d7d4dd1ca35b4a6b9314ab","observation_id":"43085501-452b-4b50-97a8-6d7ec417e90f","resolution":{"observed_at":"2026-08-07T05:47:15.062955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:13.921334Z","title":"Silero V AD: pre-trained enterprise-grade V oice Activity Detector (V AD), Number Detector and Language Classifier,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.921334Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:221fe01328a1dc64a291930c260311e720dd46020ce9959fb20a244b3058cef6","observation_id":"60401cb3-9b9e-4899-8663-ca7f1a9d073f","resolution":{"observed_at":"2026-08-07T05:47:13.921334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:14.775705Z","title":"PyTorch: an imperative style, high- performance deep learning library,","venue":null,"work_id":"f33c0814-c753-46c2-afbd-a16b9c3d7344","year":2019},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:13.960499Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:8d223440fca43b690fdfc83564df54164b0d6093e03dfd9b30c70763c618e042","observation_id":"c425acdf-4ba8-4ec4-9a02-d5a7cb25ca4e","resolution":{"observed_at":"2026-08-07T05:47:14.816798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:14.617999Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"d69e2a7f-6c9a-42a1-8276-abbccecd9e23","year":2020},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:14.010240Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:cd92a694c0a99ef15875ce3a1eef2e94cc929afc42f8c9c5e3664f019face419","observation_id":"fc38f094-28c5-4cad-b465-4167ba175604","resolution":{"observed_at":"2026-08-07T05:47:14.679549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:47:14.519760Z","title":"Modeling turn-taking in human-to-human spoken dialogue datasets us- ing self-supervised features,","venue":null,"work_id":"0881b008-6eb3-4930-b543-4de529b0fea3","year":2023},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:14.075639Z"},"links":{"citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:c86bce23f3b7cc7a9983cd395c5f24bb951eb05faef0fe879f3028803901ea9b","observation_id":"c25e00e3-6b18-4177-a50b-80c08dcf091c","resolution":{"observed_at":"2026-08-07T05:47:14.564865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14145","last_updated":"2026-06-03T23:58:01Z","snapshot_observed_at":"2026-08-07T18:03:25.418565Z","submitted_at":"2025-02-19T23:15:13Z","title":"LLM-Enhanced Dialogue Management for Full-Duplex Spoken Dialogue Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14145","snapshot_observed_at":"2026-08-07T05:47:14.122383Z","title":"Llm- enhanced dialogue management for full-duplex spoken dialogue sys- tems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:14.122383Z"},"links":{"cited_paper":"/paper/2502.14145","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:7d7bd0d690d6025d3442356e6a26859082c1afa1b63b6fe8da04a442dca7a8fb","observation_id":"2768c705-0e2b-4bd9-9b30-d63fb9d189e3","resolution":{"observed_at":"2026-08-07T05:47:14.122383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-07T05:47:14.172217Z","title":"Minmo: A multimodal large language model for seamless voice interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:14.172217Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:3d68a9a57c756b1231089821a11952ce45a5ca4ffdbd67c65d5b0024e28315a2","observation_id":"0c79f311-4e44-4233-a9bf-7396fc98ea25","resolution":{"observed_at":"2026-08-07T05:47:14.172217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2506.07081."}