{"as_of":"2026-08-07T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72307f062979e947e9947ca688086cb3a37c5781bb7ba4565f00233ded4622ad","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:37.514349Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:35.805367Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:19:47.988040Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-08-06T23:35:35.805367Z","title":"The to- kenization is described in §2.1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.805367Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:daa60cba515485460e0afd5b4585616971f0aaba948c001830e989e777b71133","observation_id":"9f94f05f-bee1-4862-8945-76bf43178963","resolution":{"observed_at":"2026-08-06T23:35:35.805367Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-08-04T11:29:35.787283Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:35.787283Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:55850580233e6bb1f808a8f388471f01b9e0e173b2089a6d9ce8029655d31bdc","observation_id":"f7ac93b2-b13d-4169-bc04-40c1e4174723","resolution":{"observed_at":"2026-08-04T11:29:35.787283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":"2506.17611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-07-04T10:19:47.988040Z","title":"Opuslm: A family of open unified speech language models,","venue":null,"work_id":"988a16ce-2ae7-40b3-91ba-aa98b5cb72a7","year":2025},"citing_paper":{"arxiv_id":"2606.22811","last_updated":"2026-06-22T03:40:28Z","snapshot_observed_at":"2026-08-02T07:12:51.277365Z","submitted_at":"2026-06-22T03:40:28Z","title":"Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T08:54:18.325054Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2606.22811"},"observation_digest":"sha256:c7031ea248392f965b28e0e20c4ba47baef4722a2e2920550997bc581789a4ce","observation_id":"2ac87cda-fac0-4a2f-84c8-27f14ebcf149","resolution":{"observed_at":"2026-07-04T10:19:47.989537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":"2506.17611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-07-04T10:19:47.988040Z","title":"Opuslm: A family of open unified speech language models,","venue":null,"work_id":"988a16ce-2ae7-40b3-91ba-aa98b5cb72a7","year":2025},"citing_paper":{"arxiv_id":"2607.02119","last_updated":"2026-07-02T12:55:11Z","snapshot_observed_at":"2026-08-04T18:11:17.418102Z","submitted_at":"2026-07-02T12:55:11Z","title":"An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-03T05:04:23.295592Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2607.02119"},"observation_digest":"sha256:f3193203c0e46e58bc7aa03d0d39ec478a77014d7ecdede955577ebd1f3a14e7","observation_id":"4e7d6f72-051e-4415-8efb-3bb12206aa9f","resolution":{"observed_at":"2026-07-03T05:07:38.317151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17611/citation-record","integrity":"/paper/2506.17611/integrity","json":"/paper/2506.17611/citation-record.json","paper":"/paper/2506.17611"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:43.164748Z","title":"This prosperity quickly spread to the speech domain and invoked the popular- ity of speech language models (SpeechLMs) [4–6]","venue":null,"work_id":"7561e7f1-e379-4d31-97df-41643076ce81","year":null},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.768809Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:24756cc3bfa7def70267eed32a98df7f637596a698b1e64c51b50a32f3bf63b4","observation_id":"3b8c5a0a-2ad1-4961-b14a-b848c46c297e","resolution":{"observed_at":"2026-08-06T23:35:43.204876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17611","snapshot_observed_at":"2026-08-06T23:35:35.805367Z","title":"The to- kenization is described in §2.1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.805367Z"},"links":{"cited_paper":"/paper/2506.17611","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:daa60cba515485460e0afd5b4585616971f0aaba948c001830e989e777b71133","observation_id":"9f94f05f-bee1-4862-8945-76bf43178963","resolution":{"observed_at":"2026-08-06T23:35:35.805367Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3690.16245","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.552528Z","title":"Experimental Setup Data:Our speech data is a mixture of YODAS [41], Emilia [42], and OWSM v3.2 suite [22]","venue":null,"work_id":"1f9c7bd9-c531-48a2-ada9-86f661cef932","year":null},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.845196Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:4b5e957c48d66c13778b579e5bc7f5d3930eb8855e2cd0ae2448c9773993f621","observation_id":"2111fd18-8b77-4f2a-bc85-96c22520c478","resolution":{"observed_at":"2026-08-06T23:35:39.596126Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.994831Z","title":"The code, data, checkpoints, and training logs are released to support open speech language model research in the community","venue":null,"work_id":"00c4f568-bed4-4aff-b125-57f6c5db15b6","year":null},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.891220Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:0c79d44bd25c721aab65f977ec701144ac57570883b47c9671e35034e4f38635","observation_id":"0c65bce9-1a68-4cfd-9bf3-0ba1d36a8361","resolution":{"observed_at":"2026-08-06T23:35:43.044755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.832249Z","title":"18Note the out-domain corpus in [25] is of sufficiently high quality, so we believe this degradation is more from domain mismatch","venue":null,"work_id":"ac0073b5-7e18-4e43-b155-5bb4fafd3b30","year":null},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.928366Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:df27d767b4255bf82aa88fe84968795cd4be64768c7854a56727a931a9c7944f","observation_id":"5673b951-608c-4260-8a48-770788453204","resolution":{"observed_at":"2026-08-06T23:35:42.894750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:35:35.964871Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.964871Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:ae99735ac13642729aff3591fad1b82a0591752447d2d48fad650d61c359fa52","observation_id":"3ff11d81-8665-4a31-9c7a-1f0999cb9d6d","resolution":{"observed_at":"2026-08-06T23:35:35.964871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:35:35.991787Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.991787Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:568ea3692c171ce68b4bac9983a0b7ac5be3b6d53dab78bb4620a3b16b1b5f04","observation_id":"da065035-e9bc-4f03-8750-778e2e82fe75","resolution":{"observed_at":"2026-08-06T23:35:35.991787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T23:35:35.998119Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:35.998119Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:b6202b1e916476e5068f204726a74a15919768fabd3f407ec71fef5c7e35e9c0","observation_id":"ff696368-a817-4e6b-9932-d2321378b2c5","resolution":{"observed_at":"2026-08-06T23:35:35.998119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-04T10:22:48.346908Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-06T23:35:36.004978Z","title":"Recent advances in speech language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.004978Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:445e42d7a16b28efa93b30d4f919ec4246416c9d1ee8acc39739564be23c344e","observation_id":"bb72e72e-eb31-46a0-8cd5-6748b6f876b0","resolution":{"observed_at":"2026-08-06T23:35:36.004978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:36.046876Z","title":"A survey on speech large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.046876Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:36fdaa9eda16e77389e070e9cc9c674f70ef693e444ee24436e49c9c02400ec4","observation_id":"73bd60e5-4c44-43e7-b345-b972a9be184a","resolution":{"observed_at":"2026-08-06T23:35:36.046876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-06T23:35:36.084747Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.084747Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:b17642338183c781c60b6dc15eb858fb349ec25b33943a85210fbdccc05f57e4","observation_id":"b65c5f37-2a5f-4cad-b67c-2cbb5e689769","resolution":{"observed_at":"2026-08-06T23:35:36.084747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T23:35:36.144749Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.144749Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:a3a823304b61b0bf1b09ad82d75032506f44920e9ec6cb72fdfad66d1b2c9446","observation_id":"8ef6a9b0-5cb3-4c18-af6d-6e8ef37cb0ea","resolution":{"observed_at":"2026-08-06T23:35:36.144749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.668023Z","title":"V oxtlm: Unified decoder-only models for consoli- dating speech recognition, synthesis and speech, text continuation tasks,","venue":null,"work_id":"b2385a76-30fe-47d5-8dc9-72f44e4182ec","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.184826Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:8514d1001ed4cef08101d9d6a4380dffefb7f33e2940dada96e6d4c2fd8db271","observation_id":"1116a37e-1c1a-4135-8dc9-802542cac382","resolution":{"observed_at":"2026-08-06T23:35:42.712790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.564747Z","title":"Uniaudio: Towards universal audio generation with large language models,","venue":null,"work_id":"8daae779-5373-4baa-a998-7d5c0a4441e6","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.226145Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:8e1d4e3d7d9063ee9c17caf0ed863d67364d83bf818c552f5361611ec34763b4","observation_id":"bb2df365-0857-4293-8b3a-fe758f918271","resolution":{"observed_at":"2026-08-06T23:35:42.598157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.474830Z","title":"SpeechX: Neural codec language model as a ver- satile speech transformer,","venue":null,"work_id":"ca3403f7-3bd2-4dbb-a060-787250d9880c","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.284828Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:d19030e05ff5106c85b02d769f9eadacb4d2fef234240e0106abbc17087b43ea","observation_id":"91e9715e-1895-40cf-980a-feaa593d1713","resolution":{"observed_at":"2026-08-06T23:35:42.497580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-06T23:35:36.334752Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.334752Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:91239745af5df8c6e1d4e25093c1e06d380e294bebd229bfc93a0fabd177a574","observation_id":"e58d9ddf-40d0-4d10-893d-ff661ecaf7eb","resolution":{"observed_at":"2026-08-06T23:35:36.334752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-06T23:35:36.384751Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.384751Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:3c38a1a5ae1ceaf9faeb5359efea23ae34e5e4b0412f6097f51363858c75bdc7","observation_id":"8be3e27d-70a3-4345-aa55-5203dfe1087e","resolution":{"observed_at":"2026-08-06T23:35:36.384751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-06T23:35:36.434750Z","title":"VITA-1.5: Towards gpt-4o level real-time vision and speech interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.434750Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:163a80367a48f6bbbb0047b92b37acc33b8b7af31c989b648774d492c74ee68c","observation_id":"4671bcde-ba59-4488-adc5-c0b8b2c4d638","resolution":{"observed_at":"2026-08-06T23:35:36.434750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-06T23:35:36.459737Z","title":"Mini-omni2: Towards open-source gpt- 4o with vision, speech and duplex capabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.459737Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:9bbd0e03a198523638ec3f2821b0f885ef42a9c0df59125276ffbe5a25c1e832","observation_id":"6c5dedfc-9ad4-4aea-a19b-e1f21db0a1b9","resolution":{"observed_at":"2026-08-06T23:35:36.459737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.431796Z","title":"GLM-4-V oice: Towards intelligent and human- like end-to-end spoken chatbot,","venue":null,"work_id":"b2f04575-e707-4406-a9bc-e14234b87cc4","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.484883Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:bb70c00d44a1388fcf1e9b8ec1e754d961d808af417bfa81ded575f70a6ec1bd","observation_id":"4ea713a3-5306-4c83-8481-dcaf28e86912","resolution":{"observed_at":"2026-08-06T23:35:42.447416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:36.524956Z","title":"Ocean-omni: To understand the world with omni- modality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.524956Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:fdcf7a14199f24d75519ab9f3c9460a1e27e9f59594c9e62c7fb98f001e19f27","observation_id":"c52f4991-75aa-4ad9-bc57-22d18667c366","resolution":{"observed_at":"2026-08-06T23:35:36.524956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:42.176322Z","title":"V oiceTextBlender: Augmenting Large Language Models with Speech Capabilities via Single-Stage Joint Speech- Text Supervised Fine-Tuning,","venue":null,"work_id":"22ac2c10-5e8e-4ac5-9ac7-9e9cd2cf6d5f","year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.551512Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:1ae0aabcccc71934e61dc7ac12341fb4262a1108e26d7dfd4e6ed97659a900a3","observation_id":"a8d48137-7d0c-489f-86b0-9e6e0c7883a8","resolution":{"observed_at":"2026-08-06T23:35:42.325354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.865121Z","title":"Role of intelligence tests in speech/language,","venue":null,"work_id":"cf1e746d-b50b-4adb-b18e-32fe72a72346","year":1996},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.568157Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:12af2e92d2880c5cd8153b42a93baf8b6c8c4c590f7c62755e434eee323f3773","observation_id":"1302e537-cbc1-4284-b308-3a2af68d494c","resolution":{"observed_at":"2026-08-06T23:35:42.026476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T23:35:36.580526Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.580526Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:40f921ddb98911da21c3d1de13c413ae46d9943d465eefb71a839eeaa77ee2f3","observation_id":"8f3ab886-beea-43fa-973c-b2a58273f08a","resolution":{"observed_at":"2026-08-06T23:35:36.580526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:35:36.595070Z","title":"Gemini: a family of highly capable multimodal mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.595070Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:9289a7e324220883af13251f4545d148d7a0fe63fb9147702b865d387a1ac418","observation_id":"4f1d3656-06bc-49ae-8278-a3baecccb410","resolution":{"observed_at":"2026-08-06T23:35:36.595070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.634955Z","title":"Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,","venue":null,"work_id":"790adeb5-81d9-4bc3-826c-bd7e681a5412","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.640226Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:a619c55ba988b8327b01aee2013e89bc9f689a08730f694f0d528b6afdd8f30e","observation_id":"26861933-ce1a-4d5e-9135-504cbd478843","resolution":{"observed_at":"2026-08-06T23:35:41.664808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.484746Z","title":"On the effects of heterogeneous data sources on speech-to-text foundation models,","venue":null,"work_id":"fc72d9bf-200d-4786-a266-88cb9cfd2681","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.659701Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:c34cd130118c1ea3394d3021db12152f0f89b1236c14fe9d5506d6a95cc4cfe5","observation_id":"fde3f299-ccb8-4ab8-b995-f13370bbca2c","resolution":{"observed_at":"2026-08-06T23:35:41.531325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-06T23:35:36.704077Z","title":"Olmo 2 furious,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.704077Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:9884126654ba1e743caf6d8bd09edd7d45ea45239233f50b5462543946daeb6a","observation_id":"7d548fb4-ed25-440b-a023-a30419e2dd8a","resolution":{"observed_at":"2026-08-06T23:35:36.704077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.364806Z","title":"Parler-tts,","venue":null,"work_id":"21c1437c-2297-4cb1-8403-3da4dab45ca8","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.735394Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:001d7e5d94627d9389a56703aef40a5a87beae4694154c4e56bcf61d51399c36","observation_id":"cc165af1-575a-49b4-8216-c7e6b40122ee","resolution":{"observed_at":"2026-08-06T23:35:41.394807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.277395Z","title":"ESPnet-SpeechLM: An open speech language model toolkit,","venue":null,"work_id":"86d243c2-9799-481d-beb5-7cd7e64f2046","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.766750Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:9b4d1414691f229bfff94c20657ae11ae27914ae3f45ccdf2bc0d3bc9e1dfc28","observation_id":"09dcac45-0ef7-426b-a577-a7b8666813e9","resolution":{"observed_at":"2026-08-06T23:35:41.315783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.144739Z","title":"Librispeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"5e59c31c-a9d1-4060-b920-fdca18d9ef84","year":2015},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.795731Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:a7deb0f6ac48d1a2467c39d39bc034d7b30cd261becee5762fbbc11415a84909","observation_id":"b92efcad-d929-43fa-b14b-628ecd758c33","resolution":{"observed_at":"2026-08-06T23:35:41.183085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T23:35:36.816221Z","title":"Measuring massive multitask language un- derstanding,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.816221Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:aeb4efad98024ff88afa31ae55f95ffac23ce4f48ef5f5e0205f8ad91576943c","observation_id":"5d1a4c94-3f59-4a24-883d-c38a21e028bd","resolution":{"observed_at":"2026-08-06T23:35:36.816221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:36.834754Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.834754Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:d4c640ec9756c3a4020af5daf54227adab0860db88e15696eadf8e9dc874319b","observation_id":"5e0c97e7-7dd4-4d1e-add7-3e9cf29eccd5","resolution":{"observed_at":"2026-08-06T23:35:36.834754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:41.003947Z","title":"Speak, read and prompt: High-fidelity text- to-speech with minimal supervision,","venue":null,"work_id":"d2d2bb02-ebeb-4f62-9982-7c20c0578092","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.880206Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:1ac25563b0208a7bd5993eafc88f81fe27945e07bd145dd0c9486b3198060d23","observation_id":"9c573230-f601-4b7c-ac62-6424680a70b1","resolution":{"observed_at":"2026-08-06T23:35:41.025369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.908855Z","title":"Audiolm: a language modeling approach to au- dio generation,","venue":null,"work_id":"1b9dc1a9-9e67-4373-bced-5210d0f0d63e","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.905232Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:8c1e060bf5627e05a8552249dd2af27e1770a58b66dfc6f8e7a2539a6968189e","observation_id":"1ee27a7c-4577-4596-9748-7656a98eb793","resolution":{"observed_at":"2026-08-06T23:35:40.926122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.802352Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"41ea802a-4fb1-4ac2-a269-76667bf1fb9a","year":2021},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.954999Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:96194895da1f77b7f83afbdf0ee9f541b9f654eb6034ddc07345a046ba4da41b","observation_id":"8b28a046-c13e-47e0-83bb-8465db3a9f11","resolution":{"observed_at":"2026-08-06T23:35:40.834738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.686383Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"73aed164-2bc7-404f-a5a6-96f332abb230","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.993493Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:3c386831267cd578f1b8de99ef7cbf08f22060d22f5c901f7b6df46f943cce19","observation_id":"ec395036-1136-4f94-aa1d-8f93c6921728","resolution":{"observed_at":"2026-08-06T23:35:40.709792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.575074Z","title":"Chattts: A generative speech model for daily dialogue","venue":null,"work_id":"8e03c6ae-146d-4bcd-adb1-ad3335424f18","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.024923Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:1d186a40e4e9361321adaf38515e505d6bc7ac75bf66be6c0c7420cb7ed2d4fb","observation_id":"e48e996f-b2a4-4258-9e71-c0d01fd405a6","resolution":{"observed_at":"2026-08-06T23:35:40.625504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T23:35:37.056647Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.056647Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:777800cb35ac81225d62e79850a9ef13040aee8c018a61b8b0b8f6a320b5cb45","observation_id":"52c982af-42cf-4abd-b1fe-a57526a91a20","resolution":{"observed_at":"2026-08-06T23:35:37.056647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T23:35:37.094892Z","title":"Gemma: Open models based on gemini research and technology,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.094892Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:5a88fa4054c4a8f488a9efe07471c00e40150427c2293e7cc000d21a64fbc1a8","observation_id":"9e742353-f459-4b9c-ac78-b736f50fc1cf","resolution":{"observed_at":"2026-08-06T23:35:37.094892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-06T23:35:37.134608Z","title":"Smollm2: When smol goes big–data- centric training of a small language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.134608Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:573b0b0ad1cc82365e41225fb87d447fe6cdbb40f23583d3866f9bf7b093ad83","observation_id":"db665f08-39dd-412a-adc2-67c86da45994","resolution":{"observed_at":"2026-08-06T23:35:37.134608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T23:35:37.174496Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.174496Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:b906e6607b46e8d0a5df1418de6d83e2c06218e4c68fde08a6a65c3b31cda3f0","observation_id":"85ea1877-d18b-41a0-930e-5a3f1e7bed1f","resolution":{"observed_at":"2026-08-06T23:35:37.174496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-06T23:35:37.204906Z","title":"Spirit-lm: Interleaved spoken and written language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.204906Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:f81734eca436576bedf75bf4cbfe3dea121ff68740aabd119782dfa996a70886","observation_id":"ca0fb67c-5e01-41e9-8158-5e48fa6eec11","resolution":{"observed_at":"2026-08-06T23:35:37.204906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T23:35:37.245740Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.245740Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:04178ffa3743dbe1e9b12b268f681f57884e7ee1332af66988d7f7ffa8eb9693","observation_id":"187d76d5-0bd2-4fa4-8b85-ed7273abebba","resolution":{"observed_at":"2026-08-06T23:35:37.245740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.461437Z","title":"Simple and controllable music generation,","venue":null,"work_id":"b64f8a59-574d-4f96-8c84-d0007ed9dca4","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.300784Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:ee49536b072bd6d8e14f51ccc3cc78e948e99568bef59111b74449c26be98001","observation_id":"4bac999b-59ee-4a72-a9a4-2d16557f4151","resolution":{"observed_at":"2026-08-06T23:35:40.490526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.322591Z","title":"Yodas: Youtube-oriented dataset for audio and speech,","venue":null,"work_id":"2eccbdf8-90b7-46cc-a19e-77e954112d38","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.372656Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:2a9d981f50b8b142bcaa287a77393df07137e1dccd80a5725572cb463925c897","observation_id":"9a757072-8620-42d5-a437-5f474632bdf8","resolution":{"observed_at":"2026-08-06T23:35:40.367605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.132308Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":"782f945b-8c29-4504-bca6-dad2ffc5752f","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.405956Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:725026c66d2631fc36e1c2bb8a3bc5ec6e5ae5b160df20a5b66b66a3a77c590a","observation_id":"ca97a751-3b71-4ba0-8951-a4cf453e6657","resolution":{"observed_at":"2026-08-06T23:35:40.184279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:40.021470Z","title":"Zero: Memory optimizations toward train- ing trillion parameter models,","venue":null,"work_id":"12acce86-0aab-432a-94b5-5500cc197749","year":2020},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.442538Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:be89fc12030e2e1ef40001d51906950661905de7dc3f18f895758d50aa388d1e","observation_id":"65ddbee9-59c0-436a-aab1-22171199b815","resolution":{"observed_at":"2026-08-06T23:35:40.045832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.944751Z","title":"PaLM: Scaling language modeling with pathways,","venue":null,"work_id":"2357d3b0-f6b3-4ff0-9966-8e4d15cc7b40","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.458194Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:c3d5708c6b54842dfaafcb164eb23e3b43fa0ef7a61fde7cfc72676707621be1","observation_id":"d9b3c04b-0266-4fb1-95c4-a650d1126fec","resolution":{"observed_at":"2026-08-06T23:35:39.974737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.839600Z","title":"FLEURS: Few-Shot Learning Evaluation of Universal Representations of Speech,","venue":null,"work_id":"2710659b-c4f7-4eea-bdd1-cebd8c00a2f6","year":2022},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.461483Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:92a4931344c600ff248aed63089aca978708a6d0e6b4a94d795f7643cc275726","observation_id":"dd4aadb3-8619-433c-bae1-7017716076b2","resolution":{"observed_at":"2026-08-06T23:35:39.856931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.797075Z","title":"Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,","venue":null,"work_id":"ab6f8f2c-090f-4024-97df-8aa83eb6df8f","year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.465720Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:221e361af45db09493ab2126534e3f725f523ad36279c965cb7ab727f2f82ec4","observation_id":"3fc516ab-3b33-4181-8635-6bca30a8bc91","resolution":{"observed_at":"2026-08-06T23:35:39.810512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.745651Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":"88c1d36c-1614-4a0e-a680-9f48bcf81c85","year":2022},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.468734Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:80340d82410f91b2ea9afc75a1de5dc62826c2f538dae27e07a388e93a47ebc5","observation_id":"08caaae5-b12d-4ccb-b00d-ae804b134964","resolution":{"observed_at":"2026-08-06T23:35:39.766985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17667","last_updated":"2025-03-27T03:50:10Z","snapshot_observed_at":"2026-08-04T18:12:22.604177Z","submitted_at":"2024-12-23T15:53:21Z","title":"VERSA: A Versatile Evaluation Toolkit for Speech, Audio, and Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17667","snapshot_observed_at":"2026-08-06T23:35:37.473556Z","title":"Versa: A versatile evaluation toolkit for speech, au- dio, and music,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.473556Z"},"links":{"cited_paper":"/paper/2412.17667","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:87a02c81e35661d271edc61bf81155ed8a1bf82f0f2bf9c6736d533da9c9949f","observation_id":"65ee1f7f-35da-48d7-a95e-209464a251ed","resolution":{"observed_at":"2026-08-06T23:35:37.473556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:37.496340Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.496340Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:0d4449303d5b5252a0a8f7826aa61e47a34169c88ace93d42c4e0862b04035fc","observation_id":"a9101987-efe9-471d-ac91-c6d6b31b1f83","resolution":{"observed_at":"2026-08-06T23:35:37.496340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.688016Z","title":"CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit,","venue":null,"work_id":"20a71248-3dfe-47c5-b6a7-c8ead271d4d2","year":2019},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.500919Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:ec18c2430c0457263b0bdd2cc94f9a0aeed295786540839765e697a32d68069c","observation_id":"daa7046c-f4db-4b86-b692-c43c444eba75","resolution":{"observed_at":"2026-08-06T23:35:39.691760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.669460Z","title":"GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio,","venue":null,"work_id":"6fe5e62e-f592-4dcf-bb44-3fd09ff835f3","year":2021},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.509743Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:9c70bf6f5b9c0c9780eca1a08a84ee1ccea2588f1016270f21aad57b4f5ebd79","observation_id":"7a57c7ba-333d-4465-bc03-0569157b14cd","resolution":{"observed_at":"2026-08-06T23:35:39.673426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:39.655810Z","title":"Libriheavy: a 50,000 hours asr corpus with punc- tuation casing and context,","venue":null,"work_id":"77680d6f-ab78-4fbc-a7f7-419e7ddd0048","year":2023},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:37.514349Z"},"links":{"citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:0e045180354c8cda6671bdf819654c5c292c18dd46737cd8d921027cd2531be9","observation_id":"6c9ed181-5e46-4ca3-851f-922926ed02af","resolution":{"observed_at":"2026-08-06T23:35:39.661422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:28:11.499806Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 4 inbound Pith citation observations for arXiv:2506.17611."}