{"as_of":"2026-08-21T03:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a38e634e761d79a30d9ccc6160ccfb10887411af6a30043eecea13182f529e3d","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-07T14:53:07.512543Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05365/citation-record","integrity":"/paper/2607.05365/integrity","json":"/paper/2607.05365/citation-record.json","paper":"/paper/2607.05365"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.902277Z","title":"Large language models: a survey of their development, capabilities, and applications","venue":null,"work_id":"55df9433-dd4f-4aeb-a0ed-da80ef34daa1","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:234c6765b8532e2766750b8b97157e09f6e5fcd62f12a68e97d710aaca189e2f","observation_id":"dc7450df-764d-4b75-a05a-f4c73542b24b","resolution":{"observed_at":"2026-07-07T14:53:55.903780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-08-14T11:32:49.145887Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2504.08528","doi":"10.48550/arxiv.2504.08528","metadata_source":"pith","pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","venue":"cs.CL","work_id":"92746bbc-1fe6-410d-a1e9-8afab3e0a8e5","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:7b32fd38848c96f78a3e8d914f57ccc4648864782ebe27bb226e3da22179882d","observation_id":"c0214adf-85b2-4627-8455-f5efab4214b6","resolution":{"observed_at":"2026-07-07T14:53:55.732536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.910782Z","title":"A full-duplex speech dialogue scheme based on large language model,","venue":null,"work_id":"c3147d90-7367-4014-b68e-11f61df6f19d","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:e523c9cab65e7595c81a9b630927377a2ea3c1191c169154ff1f948d8f9bd8d2","observation_id":"427e98d8-9ab9-4078-a8d8-bb828dbff0cf","resolution":{"observed_at":"2026-07-07T14:53:55.912115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.935615Z","title":"Human conversational behavior,","venue":null,"work_id":"c73b9c85-6df2-456c-a045-cef8feaca955","year":1997},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:f60828bd9f11b925de1b9ff2cb1dfbba8b61e5f530b860366dd33426f1c10b42","observation_id":"3c52f983-cf20-40c2-8b83-86ae60aaa1d8","resolution":{"observed_at":"2026-07-07T14:53:55.936847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.908807Z","title":"6 conversation analytic approaches to the relevance and uses of relationship categories in interaction,","venue":null,"work_id":"549f3304-5861-4862-8ca4-7b26600e7ae1","year":2004},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:dc38da5cc2f27239b7760b1d460ec5dfd39b7386eb6ba830df46f53f72f6abea","observation_id":"f059b1cd-71b6-457b-98ae-4e4e97b2114f","resolution":{"observed_at":"2026-07-07T14:53:55.910160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.13686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.776778Z","title":"τ-voice: Benchmarking full-duplex voice agents on real-world domains","venue":null,"work_id":"c4040e48-4bc5-465c-9fea-df887e8f4fdd","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:e5e29eb85b7475c470f9c89130301c2d42741a3f30c6a9c6d36275dc0ec0fe47","observation_id":"433d7776-909d-433f-87ed-3cbac7bbcdd1","resolution":{"observed_at":"2026-07-07T14:53:55.778510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21875","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.749214Z","title":"Wildspeech-bench: Benchmarking end-to-end speechllms in the wild","venue":null,"work_id":"0d282d54-dce1-40c1-acbd-984e209ce677","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:71d41eb24e4a81e3cc377866f5c4512e03c25fc656738c3a494e6e33a5bcb097","observation_id":"6e032512-eb4d-4e5c-b6e0-4afe4a7c4b3c","resolution":{"observed_at":"2026-07-07T14:53:55.751211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.906709Z","title":"Full-duplex-bench v1. 5: Evaluating overlap handling for full-duplex speech models,","venue":null,"work_id":"af4392b9-19f8-45b4-89c5-784a4d31173f","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:e51f9eec3b432de4c411de717079dbc94196459676bff290574cc0054701c870","observation_id":"53d58aa6-b453-4969-a737-34720ed263dd","resolution":{"observed_at":"2026-07-07T14:53:55.908186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22554","last_updated":"2025-07-01T01:02:44Z","snapshot_observed_at":"2026-08-19T23:31:28.581667Z","submitted_at":"2025-06-27T18:09:49Z","title":"Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset","version":2},"cited_work":{"arxiv_id":"2506.22554","doi":"10.48550/arxiv.2506.22554","metadata_source":"pith","pith_arxiv_id":"2506.22554","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seam- less interaction: Dyadic audiovisual motion modeling and large-scale dataset","venue":"cs.CV","work_id":"bd72e66a-91a8-4a2d-a45c-b91cc08c2ab3","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2506.22554","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:93fa7579ca7da40f3c2c6b0ac7bc41079f265c1070fa651aa2150aeddac5e03e","observation_id":"773c2f82-c687-45cb-bfac-10ecfa0f2a43","resolution":{"observed_at":"2026-07-07T14:53:55.735818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-10T20:38:19.759747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T20:38:19.759747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30543","last_updated":"2026-07-03T22:13:04Z","snapshot_observed_at":"2026-08-19T08:13:23.717728Z","submitted_at":"2026-06-29T16:42:24Z","title":"TRACE: Temporal Relationship-Aware Conversational Entrainment Detection in Dyadic Speech","version":2},"cited_work":{"arxiv_id":"2606.30543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.30543","snapshot_observed_at":"2026-07-07T14:53:55.782897Z","title":"TRACE: Temporal Relationship-Aware Conversational Entrainment Detection in Dyadic Speech","venue":"cs.CL","work_id":"ddf882d4-4b92-4791-909b-bf2bddf8bfe8","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2606.30543","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:c4958e357d88250e2197973f550c198002ba90f5029a97f129a2059f7273e2ed","observation_id":"958289ae-5a6d-414d-a0a9-a99bbd810356","resolution":{"observed_at":"2026-07-07T14:53:55.784312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10827","last_updated":"2025-06-12T15:44:55Z","snapshot_observed_at":"2026-08-13T17:52:08.247003Z","submitted_at":"2025-06-12T15:44:55Z","title":"The embedded deformation problem for monomial ideals","version":1},"cited_work":{"arxiv_id":"2506.10827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10827","snapshot_observed_at":"2026-07-07T14:53:55.774077Z","title":"The embedded deformation problem for monomial ideals","venue":"math.AC","work_id":"37d9f79a-8292-4761-b9e0-ffe86050335c","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2506.10827","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:733edbc0e6f63474c5c85571b662e57541043c522e9ee0b2b4b937edae65ff18","observation_id":"20d93fba-99d0-44ec-882d-0df67967d16a","resolution":{"observed_at":"2026-07-07T14:53:55.775591Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.01345","last_updated":"2026-07-05T19:53:45Z","snapshot_observed_at":"2026-08-14T10:16:36.384280Z","submitted_at":"2026-07-01T18:03:09Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","version":2},"cited_work":{"arxiv_id":"2607.01345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.01345","snapshot_observed_at":"2026-07-07T14:53:55.743509Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","venue":"cs.CL","work_id":"5098a165-2c38-4510-9f93-a7837e9305c1","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2607.01345","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:7a6b8dfdf4932211b997fc0a498821e0186e8f8a911ab62ca2117b92d74ba734","observation_id":"6145d9e5-6b24-4931-af5b-6192f990cacd","resolution":{"observed_at":"2026-07-07T14:53:55.744939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14648","last_updated":"2025-05-20T17:36:41Z","snapshot_observed_at":"2026-08-19T20:26:23.124920Z","submitted_at":"2025-05-20T17:36:41Z","title":"Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits","version":1},"cited_work":{"arxiv_id":"2505.14648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14648","snapshot_observed_at":"2026-07-07T14:53:55.753054Z","title":"V ox-profile: A speech foundation model benchmark for characterizing diverse speaker and speech traits","venue":"cs.SD","work_id":"2829cdaf-42fb-4b6b-b9d7-3a59c98f8736","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2505.14648","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:c083c6b466c514fa71b2266c013abf30dfaf29194aa589196830cccc5015608f","observation_id":"246f4cc5-1e1a-46d1-9a95-d50bd62fcb29","resolution":{"observed_at":"2026-07-07T14:53:55.757166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.924060Z","title":"V oxlect: A speech foundation model benchmark for modeling dialects and regional languages around the globe,","venue":null,"work_id":"5b24e927-f0d2-4da3-8a9a-b4c5223a4182","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:b271324dcf414f8e8e35368f8b5ef340d9fe34bc098d2db9d1f1dcaa8f7d032d","observation_id":"14813de2-cbdc-4dbe-bd0d-51dbad3be517","resolution":{"observed_at":"2026-07-07T14:53:55.925345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.933743Z","title":"Reference-based prosody and rhythm evaluation for spoken dialogue systems,","venue":null,"work_id":"0aaacc1b-1300-4581-96f2-e271db615642","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:f263520087cbacf84c01224dd7f5ffe771f0c5b2569c3c97cd764cbcdc19a699","observation_id":"bacf8d78-19bc-4613-8e4d-05e873f6dd5f","resolution":{"observed_at":"2026-07-07T14:53:55.935018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T20:34:09.810325Z","title":"Gpt-4 technical report,","venue":null,"work_id":"be55e249-c3cc-451d-ad93-66e96b98c47c","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:fcde613a7544757a2a9e74688b8f9e8469178ad449912287d7bd209e5fb6ca6c","observation_id":"2a3ba648-7f3d-461d-8de8-5a2e3c0b2b57","resolution":{"observed_at":"2026-07-07T14:53:55.917785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:363a6513f016d2b539576f0cdd942294c8ec278d424544a8a04b2afa30341b78","observation_id":"37c4a746-c714-4e72-b644-0e91bdc7d1e9","resolution":{"observed_at":"2026-07-07T14:53:55.781561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:12.229447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:42fa403b212dfde82a27909346115a262b5ef0e61d8fe0efc3491cb2201127b1","observation_id":"1f68a723-5ecc-486a-8b52-c87389211192","resolution":{"observed_at":"2026-07-07T14:53:55.765795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-16T15:04:18.834535Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":"2308.16692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-07-07T14:53:55.714650Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":"cs.CL","work_id":"62130e73-990e-433b-8489-b221c866cc4b","year":2023},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:51ca19713d67aae7c64e9395a9902aa3c850b71ff112ab70ceeab989e2fd8220","observation_id":"e6451e05-4307-47ec-9477-f9e7730f820b","resolution":{"observed_at":"2026-07-07T14:53:55.721428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03183","last_updated":"2023-07-06T17:58:28Z","snapshot_observed_at":"2026-08-16T15:18:09.177606Z","submitted_at":"2023-07-06T17:58:28Z","title":"Whisper-AT: Noise-Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers","version":1},"cited_work":{"arxiv_id":"2307.03183","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.03183","snapshot_observed_at":"2026-07-07T14:53:55.737392Z","title":"Whisper-AT: Noise-Robust Automatic Speech Recognizers are Also Strong General Audio Event Taggers","venue":"cs.SD","work_id":"82d7ec8e-14d8-4501-9a22-55f62f950f44","year":2023},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2307.03183","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:3890b4f587bf6b0b1455ab1565df8882a9d41c4838f3d763a9c2cdafcff3a18c","observation_id":"68ee057e-8f93-4c68-8492-a4431557e16e","resolution":{"observed_at":"2026-07-07T14:53:55.739204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-08-13T02:49:58.912820Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:a92c6aeb4515e1d3a624c759f7bdb364b5c8e49a3942d4c036539c01eee10431","observation_id":"1b25f448-0516-4ce6-9eb5-5b22cf2f06ad","resolution":{"observed_at":"2026-07-07T14:53:55.768753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.929779Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"7490689b-1e6b-4856-b4e3-803ae1e3fab1","year":2021},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:2d403ede54fa66ab6ac9e7348e3ae461022b07e8f4f574a4a772ac0bdbbac415","observation_id":"e4a0d144-2bc2-425e-a32b-fcc7328db780","resolution":{"observed_at":"2026-07-07T14:53:55.931192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-14T22:05:39.651975Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":"2006.11477","doi":"10.48550/arxiv.2006.11477","metadata_source":"pith","pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"URL http://proceedings.mlr.press/ v37/allamanis15.html","venue":"cs.CL","work_id":"453ebac7-2aaa-4384-b2aa-2f73ad059753","year":2020},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:9055658ed9a45a59b1a5b4cfa2e818f354c192f5b277e9ee0e738776f5ba7dc0","observation_id":"ebc32acf-4467-4bf3-9e49-bd6764b6407b","resolution":{"observed_at":"2026-07-07T14:53:55.742174Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-08T00:08:08.626994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T00:08:08.626994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.918403Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing","venue":null,"work_id":"2520f0fc-fb5e-4d3d-bd23-a4d85fc4a9ec","year":2022},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:66cef17668904a403d6921aaae9e305f4f09ca789c21e1e2b6cbcf321863c4c4","observation_id":"6523c40a-596a-4e69-acc8-8482fa6de632","resolution":{"observed_at":"2026-07-07T14:53:55.919746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:e8efdd1098e75e0e8baad2f1ee8b005922e3371a00ed338024ec16df0a98582f","observation_id":"6e4c7289-d80d-4a0b-906f-af201dded00d","resolution":{"observed_at":"2026-07-07T14:53:55.789976Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:3fed19e550b96ff4b691282e65989cc551d7f3023ca2c6ecb9e9da1726a9a815","observation_id":"5cee6b7c-d768-438a-b8c4-e136211ac1bd","resolution":{"observed_at":"2026-07-07T14:53:55.725759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.952787Z","title":"gpt-audio-1.5,","venue":null,"work_id":"d9034e66-a80c-45d6-906b-a0e4033d7868","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:fd8f249ce82886812da185e5535f8aa0741157b2a24246dab35669c9c3ccb899","observation_id":"2af54508-abda-4e58-9ccc-cea4c3721ea5","resolution":{"observed_at":"2026-07-07T14:53:55.953866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:ca24f53923f1d7a9e648ae15b83002914e4275488ddd0f2917025726850e210a","observation_id":"f8cfa9fe-64d6-45b9-b037-949d80bc8d77","resolution":{"observed_at":"2026-07-07T14:53:55.787189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:13.453678+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:13.453678+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.922339Z","title":"gpt-realtime-2,","venue":null,"work_id":"c7d9f588-af5c-4af4-95af-096977d87399","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:8a424868259c046c36282d9f5ce35cfea450c2dfa157e5d223292da158c1b623","observation_id":"6875b2f9-7546-44c0-b64c-2ce42d4095d1","resolution":{"observed_at":"2026-07-07T14:53:55.923464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:4d71e48f7a2575af8d090468b7e81e2eba3d5f1d2abae4fbdbbfa1ac9f877460","observation_id":"45f5a163-01fb-4a37-9d1c-a3b040895e44","resolution":{"observed_at":"2026-07-07T14:53:55.747819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.904428Z","title":"gemini-3.1-flash-live-preview,","venue":null,"work_id":"ff79abf6-6942-4963-bcb4-a356d1728e63","year":null},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:a4288b0c0d2c40c38c566ba200f850f4f1a5938cdd5f8b7708ec2c6516a95ccb","observation_id":"2ef3b95b-e22e-4b52-b992-09178b36372c","resolution":{"observed_at":"2026-07-07T14:53:55.906037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.945126Z","title":"Available: https://ai.google.dev/gemini-api/docs/models/ gemini-3.1-flash-live-preview","venue":null,"work_id":"f8543da5-2ed5-4673-9717-b769ed2b06ed","year":null},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:e4473f0021946e0068ae8a8e03e2da78d7bd5560c712c786eba271f773ad3c89","observation_id":"672dc707-08c5-4bf4-879a-e306953c57e0","resolution":{"observed_at":"2026-07-07T14:53:55.946630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-08-20T16:00:12.325133Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":"2408.16725","doi":"10.48550/arxiv.2408.16725","metadata_source":"pith","pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":"cs.AI","work_id":"5192d640-6f69-48bb-b5e7-c2eb57e52726","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:396f59dbd6df10666e010a03a4b3077cb2112ee330972516ba48df45c49f1070","observation_id":"833cd489-af27-4686-a29a-c5550f69ea82","resolution":{"observed_at":"2026-07-07T14:53:55.792681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.951151Z","title":"Couper-Kuhlen and M","venue":null,"work_id":"562cf653-1535-46d8-9949-83125a06c183","year":1996},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:10e32a8d577f8e74c9a1f8c64f37c8d4d34c0113445ecc030180784d7fb47f1f","observation_id":"3f0d91e3-f456-4abc-988f-0eb5097149a9","resolution":{"observed_at":"2026-07-07T14:53:55.952210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.912745Z","title":"Phonetics and prosody in conversation,","venue":null,"work_id":"711081ff-21a7-41ce-8f24-217215b9f26f","year":2012},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:6d6d5e4b7a47c0cfb709de3367b562bb717db1b99a5bdc3155c08d23ffb4a7aa","observation_id":"7de617d4-6af4-465b-9871-cb130e888db0","resolution":{"observed_at":"2026-07-07T14:53:55.914007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.931830Z","title":"Classifying conversational entrainment of speech behavior: An expanded framework and review,","venue":null,"work_id":"610387e6-6b51-4f0b-b2e1-2ef95091a13f","year":2022},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:fffd815788a4c592d571ae30fc053bebddafb3cd137e527442a872ebedb2a6da","observation_id":"3ef9f11a-b666-45b0-8a15-289f9e09dd15","resolution":{"observed_at":"2026-07-07T14:53:55.933124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.941234Z","title":"A cross-linguistic analysis of the temporal dynamics of turn-taking cues using machine learning as a descriptive tool,","venue":null,"work_id":"bcf32df5-a3f9-43ca-b95c-aac7e07fc587","year":2020},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:923946504adeba14d8676ed73e9d22b9b357f2b5da6be3a8f5d70e31a3e34e0e","observation_id":"6c539f27-3f84-48e2-b3b9-902682b1394e","resolution":{"observed_at":"2026-07-07T14:53:55.942604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.937475Z","title":"Real-time changes to social dynamics in human-robot turn-taking,","venue":null,"work_id":"732f794c-af46-4cfd-a915-ca25e255e11b","year":2015},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:c53e9389f043017c2772dbfd77880b45cbe00b0c685f0440785025ac757f1b04","observation_id":"b178f409-8385-43b5-bf6b-4cb8bd75f504","resolution":{"observed_at":"2026-07-07T14:53:55.938750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01174","last_updated":"2025-03-03T04:46:04Z","snapshot_observed_at":"2026-08-20T00:16:26.785032Z","submitted_at":"2025-03-03T04:46:04Z","title":"Talking Turns: Benchmarking Audio Foundation Models on Turn-Taking Dynamics","version":1},"cited_work":{"arxiv_id":"2503.01174","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.01174","snapshot_observed_at":"2026-07-07T14:53:55.794102Z","title":"Talking turns: Benchmarking audio foundation models on turn-taking dynamics","venue":"cs.CL","work_id":"ceeb072e-0415-4508-999c-bcb728f2e57a","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2503.01174","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:2777a3b3f3ce683eb7387c4fb0af0c400d931389317b502ff28d8a58ed1388ea","observation_id":"2a5d849a-7bfb-46ab-a75d-972749ffa3a9","resolution":{"observed_at":"2026-07-07T14:53:55.795345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-20T05:06:38.014724Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":"2204.02152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-07-07T14:53:55.727508Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":"cs.SD","work_id":"672f99d7-62cc-4d7d-931c-4e7b0083fcd9","year":2022},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:963ccb9600b374b67fd3aed79172986d92b8a7513b1b572198b4b58e99534c6c","observation_id":"58a2debd-d7d6-4ee8-a37d-569b059d42b7","resolution":{"observed_at":"2026-07-07T14:53:55.729253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-08-16T18:27:20.253405Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":"2105.01051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-07-07T14:53:55.761527Z","title":"arXiv preprint arXiv:2105.01051 , year=","venue":"cs.CL","work_id":"7509ab27-75f2-4438-96ee-f6612ef7e1ce","year":2021},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:58ca9547a3cb2b8b1a87326c9a8803a287fffe2ab67d59679951013106942df6","observation_id":"7963645b-9cd7-4068-b5d1-df5bcd427f8c","resolution":{"observed_at":"2026-07-07T14:53:55.763035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.897819Z","title":"Wildbench: Benchmarking llms with chal- lenging tasks from real users in the wild,","venue":null,"work_id":"33100040-23fc-4248-a3df-f652b0462305","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:fc938a52204999bd31a1125cd1a7776e67dce52a05c7d3bac5f94106af65addc","observation_id":"72874aac-fc2e-4d92-a913-36525bedd6ec","resolution":{"observed_at":"2026-07-07T14:53:55.899239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.943193Z","title":"Mt-bench-101: A fine-grained benchmark for evaluat- ing large language models in multi-turn dialogues,","venue":null,"work_id":"440af494-d889-4506-804a-18c07f152ecb","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:16deb66d5c7193a0870c6fd6b5bb4335dd02aca347ca42def6c7a76c6a1446fc","observation_id":"df14cba5-6600-43aa-8d0a-03da7266391e","resolution":{"observed_at":"2026-07-07T14:53:55.944519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.895501Z","title":"Air-bench: Benchmarking large audio-language models via generative comprehension","venue":null,"work_id":"a0ac9aad-0982-4c9d-a40f-e17bbaab5449","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:f4301981ef9cea4a64b4a2a866b49b0ccfb0d0d31a46611fe24d81f59f4a2ffd","observation_id":"3fd36e6a-1423-48c6-be2f-d35fc0a42f88","resolution":{"observed_at":"2026-07-07T14:53:55.897127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08194","last_updated":"2026-06-06T14:24:05Z","snapshot_observed_at":"2026-08-15T09:10:38.316635Z","submitted_at":"2026-06-06T14:24:05Z","title":"GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2606.08194","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.08194","snapshot_observed_at":"2026-07-07T14:53:55.796895Z","title":"GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models","venue":"cs.CL","work_id":"165a3053-73db-41e7-a7ed-508cf78ef360","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2606.08194","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:e6ffeb18794da4b7f0e7bb8d02f5786949e3eb2cbfb29805460a1a4aafb4b332","observation_id":"eb11fc14-eb85-4ad7-9e72-e1cd047fd8f4","resolution":{"observed_at":"2026-07-07T14:53:55.798196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.947250Z","title":"A systematic survey and critical review on evaluating large language models: Challenges, limitations, and recommendations,","venue":null,"work_id":"dd7b8fcb-34e9-46a7-be4e-1ecc0b663383","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:82778794e8a4f767251ed4d70275079affdde8876f2c4bb32fb7ef82ec0cafbe","observation_id":"95d45456-7a28-49fb-8a71-4bc749c5846a","resolution":{"observed_at":"2026-07-07T14:53:55.948517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22243","doi":"10.48550/arxiv.2509.22243","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flexi: Benchmarking full-duplex human-llm speech interaction","venue":"ArXiv.org","work_id":"4483688c-8b5a-4f92-a547-5261a86e194e","year":2025},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:8e19274e7461fdf441a9cedc9f6503347b2a0b4cebc679c201b7af82110c94bc","observation_id":"19bc96f1-8ff8-4314-8945-1e6bd1df7318","resolution":{"observed_at":"2026-07-07T14:53:55.772890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.899949Z","title":"Speech to Speech AI Model & Provider Leaderboard,","venue":null,"work_id":"634d9a91-7506-48b4-93c9-b135d2217ef7","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:c49533227e433e4d03d0f3fc772ea5ad47642689f1940666c5a4d323bbd39059","observation_id":"22847e6f-472d-47e5-ba87-f613595d12f8","resolution":{"observed_at":"2026-07-07T14:53:55.901621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.949121Z","title":"Speech Arena Leaderboard,","venue":null,"work_id":"645ef0bd-9bd6-4699-bed3-e17298455853","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:f74eccf78de45c235179cf4c017d4bb5b4e7490acb4becc89f4be1f5369f87e4","observation_id":"c171b547-75ff-440c-9627-1f245b46f0ea","resolution":{"observed_at":"2026-07-07T14:53:55.950560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.925967Z","title":"Methodology — V oice Arena TTS Leaderboard,","venue":null,"work_id":"a05b6e17-c11c-4e1c-909e-68cf8efae887","year":2026},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:e12b9a70fe79fbd0dff775e542f123657b015f383310ae34726d8e09e93ea144","observation_id":"4896ad97-aefb-460b-95fc-6f5c3b7af505","resolution":{"observed_at":"2026-07-07T14:53:55.927225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T11:34:51.584322Z","title":"Robust speech recognition via large-scale weak supervi- sion","venue":null,"work_id":"37ff6ae8-a2cd-4b97-90aa-04010fd36792","year":2023},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:8d7776b5d40871b272330b7148fc7c710be3e17b7009c75164564bdddf2743c2","observation_id":"a5bc260d-d5cf-4da2-bf96-6f608301c6a2","resolution":{"observed_at":"2026-07-07T14:53:55.921760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.927822Z","title":"Silero vad: pre-trained enterprise-grade voice activity detec- tor (vad), number detector and language classifier","venue":null,"work_id":"cf52c7ab-6e74-46c2-a843-a78c1eb494b8","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:c8e34421a0dc01d98da41ff94dc65d3b07e50435fd2ec734f9a77a912e43ee30","observation_id":"e4d3f6f8-6931-484c-9920-270b1c54a3b3","resolution":{"observed_at":"2026-07-07T14:53:55.929150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.914600Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":"c3cde7f9-f5f6-4be3-911f-b234dd317d59","year":2023},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:47047225014615422a805f457042d84b75b31a665cd1333a8f4f9c5a2b438d18","observation_id":"7c7bcfee-af00-4e22-89d1-41686b8569ba","resolution":{"observed_at":"2026-07-07T14:53:55.915901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:14:01.390497Z","title":"Fleurs: Few-shot learning evaluation of universal representations of speech","venue":null,"work_id":"a78f5a65-13e2-4ec7-a02c-1c87bfd6fa5b","year":2023},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:7f29b41d34f34567acbede748b2bb5f1907e15a146d081637d9874f26fa73278","observation_id":"190783a9-186b-4d73-866f-6a86eab5e424","resolution":{"observed_at":"2026-07-07T14:53:55.940618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:d35b0690b5cda4aa1be3ada6f6cbb2289669b8894fc7b6fdd63f6ff4e77ff243","observation_id":"e4a23d02-3103-45fa-b218-a91b57672ee8","resolution":{"observed_at":"2026-07-07T14:53:55.760237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T16:59:23.044763Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":21,"verified_fuzzy":30},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.05365."}