{"as_of":"2026-08-08T00:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdf0f442801a85599cc47026e945f3a5a0cd253f43f7284d19abd1ced6ed8108","coverage":[{"denominator":165,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:28:54.976320Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T09:46:15.701501Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:39:46.872455Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"cited_work":{"arxiv_id":"2506.02443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02443","snapshot_observed_at":"2026-07-04T09:39:46.872455Z","title":null,"venue":null,"work_id":"34063876-18bb-45fd-8555-6a095beb296a","year":2025},"citing_paper":{"arxiv_id":"2605.18779","last_updated":"2026-04-28T15:57:54Z","snapshot_observed_at":"2026-08-05T09:01:03.493159Z","submitted_at":"2026-04-28T15:57:54Z","title":"Achieving Generational Peace in Mali through Intergenerational Mean-Field-Type Game-based Incentives","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T00:58:13.403170Z"},"links":{"cited_paper":"/paper/2506.02443","citing_paper":"/paper/2605.18779"},"observation_digest":"sha256:240e31ee0689ce2cb2cc5efdbf0992a9f9402f87cf3c617005d2e4bee4c25052","observation_id":"b97f05c3-f9ac-40d9-8c1e-c8c2a4cb0a72","resolution":{"observed_at":"2026-05-21T00:59:19.261302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"cited_work":{"arxiv_id":"2506.02443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02443","snapshot_observed_at":"2026-07-04T09:39:46.872455Z","title":null,"venue":null,"work_id":"34063876-18bb-45fd-8555-6a095beb296a","year":2025},"citing_paper":{"arxiv_id":"2606.22512","last_updated":"2026-06-21T14:05:55Z","snapshot_observed_at":"2026-08-06T17:27:30.430962Z","submitted_at":"2026-06-21T14:05:55Z","title":"Mitigating Polycentric Conflict-Trap Risk in Mali via Intergenerational Volterra Mean-Field-Type Games","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T09:46:15.701501Z"},"links":{"cited_paper":"/paper/2506.02443","citing_paper":"/paper/2606.22512"},"observation_digest":"sha256:6562abfa1cce7775804b4cba6530f10b9e5663bc1d9ec076fe278631852e2a2e","observation_id":"e83bdcdb-5e9f-4667-9220-e8c24470eaa5","resolution":{"observed_at":"2026-07-04T09:39:46.381030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"cited_work":{"arxiv_id":"2506.02443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02443","snapshot_observed_at":"2026-07-04T09:39:46.872455Z","title":null,"venue":null,"work_id":"34063876-18bb-45fd-8555-6a095beb296a","year":2025},"citing_paper":{"arxiv_id":"2606.22524","last_updated":"2026-06-23T09:11:48Z","snapshot_observed_at":"2026-08-03T01:09:41.797918Z","submitted_at":"2026-06-21T14:22:06Z","title":"Risk-Aware Information Theory","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T09:41:41.049881Z"},"links":{"cited_paper":"/paper/2506.02443","citing_paper":"/paper/2606.22524"},"observation_digest":"sha256:5de11e4866329d2c16f7790531e4c3bfde16102f4ba003e18cce00c98e80cca7","observation_id":"f7b6c78e-a369-4e67-867a-2a4f67fa9319","resolution":{"observed_at":"2026-07-04T09:39:46.873728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02443/citation-record","integrity":"/paper/2506.02443/integrity","json":"/paper/2506.02443/citation-record.json","paper":"/paper/2506.02443"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:45.767223Z","title":"Simultron: On-device simultaneous speech to speech translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:45.767223Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:dd63621502df4da106dad1ada67474190f5b5ad9051a73f8a7d9bf8d884a6d74","observation_id":"c6c2304a-23ac-4914-ba28-4f55fc9e71c3","resolution":{"observed_at":"2026-08-07T11:28:45.767223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:45.821059Z","title":"Qwen 2.5: A comprehensive review of the leading resource-efficient llm with potentioal to surpass all competitors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:45.821059Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:d08d243663224a74aeba495fbfffc863da3371ec06b9ac0fe465be4bebe3a134","observation_id":"873835c3-1a3e-4f91-b08d-eda15d57db18","resolution":{"observed_at":"2026-08-07T11:28:45.821059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:45.924856Z","title":"Analysis of layer- wise training in direct speech to speech translation using bi-lstm","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:45.924856Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:48ace40d6df1f02d625ac3f730fdb5e315cc99a79faea551625c80f287309658","observation_id":"32a0ea4b-8888-4f91-83a8-5d35e1858e85","resolution":{"observed_at":"2026-08-07T11:28:45.924856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.038879Z","title":"Precipitation nowcasting with generative diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.038879Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:a0549ce1b70d254dd34f9e11496c99f7d458d994b4262cff14dcaf7b63c52d74","observation_id":"2a273406-4bde-489e-bdd9-71d54fcd955a","resolution":{"observed_at":"2026-08-07T11:28:46.038879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.191304Z","title":"Mean-Field-Type Game Theory: Applica- tions, volume 2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.191304Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:4ad7c06b0266e1eb55a434f88d5fef392c0107e535ed98a5d7600be0f9f48223","observation_id":"3b8fe074-38c4-4a16-aaab-be8e14324918","resolution":{"observed_at":"2026-08-07T11:28:46.191304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.297443Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.297443Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:e6c69cfeecd51795daac621b6d6a79a948a915d8a2d7ec8cd6992530f71fee3c","observation_id":"50a12541-1011-418a-890b-61774aaf52b1","resolution":{"observed_at":"2026-08-07T11:28:46.297443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01744","last_updated":"2016-12-06T10:48:56Z","snapshot_observed_at":"2026-07-06T05:21:31.168402Z","submitted_at":"2016-12-06T10:48:56Z","title":"Listen and Translate: A Proof of Concept for End-to-End Speech-to-Text Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01744","snapshot_observed_at":"2026-08-07T11:28:46.397405Z","title":"Listen and translate: A proof of concept for end-to-end speech-to-text translation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.397405Z"},"links":{"cited_paper":"/paper/1612.01744","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:13c0b1ec5ecf63fd04fcc18d4aec7f2bbb1724c66c939f9a80a0c900e0c62c1a","observation_id":"f7990542-4be9-4a87-90b4-55da5b2b7ea4","resolution":{"observed_at":"2026-08-07T11:28:46.397405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.487794Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.487794Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b953fb0f60417d2e8b1f97703489ae3d91fab269c01114b4f667fd4a8f66f8ab","observation_id":"1c201fa9-12a9-4fbd-933a-bcdce127e9ac","resolution":{"observed_at":"2026-08-07T11:28:46.487794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.586257Z","title":"Large language models are strong audio-visual speech recognition learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.586257Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:70f62e4364fa624270745701eed80b4ea5b88ab144b0437f3e515975163099e4","observation_id":"c72b7324-91de-4b01-9e1e-f8fae1dd1ebd","resolution":{"observed_at":"2026-08-07T11:28:46.586257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.705659Z","title":"Low frame-rate speech codec: a codec designed for fast high-quality speech llm training and inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.705659Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:08732ef1be3c4af2e0afea06ce676894696679238ba4e4ba71bc0cd873fb2458","observation_id":"82501d3c-2e97-4271-9597-0295d15f6637","resolution":{"observed_at":"2026-08-07T11:28:46.705659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.827097Z","title":"A speech-to-speech translation based interface for tourism","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.827097Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:1590d4c603d512abf31cf42dbf1718b0445236fd8b4ec036dc7de62cc902e605","observation_id":"8355f08a-cb85-47f3-8dae-a183f17c899a","resolution":{"observed_at":"2026-08-07T11:28:46.827097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:46.942799Z","title":"Exploring in-context learning of textless speech language model for speech classification tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:46.942799Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f44061a2f17966611cad468bdf9945fb41d51fd49edc8c590c918d27c06cb78e","observation_id":"257d59fa-52f2-480f-942e-00eab9818c01","resolution":{"observed_at":"2026-08-07T11:28:46.942799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17202","last_updated":"2025-03-12T02:01:46Z","snapshot_observed_at":"2026-07-06T20:27:32.742145Z","submitted_at":"2025-01-27T22:47:51Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17202","snapshot_observed_at":"2026-08-07T11:28:47.037457Z","title":"Audio large language models can be descriptive speech quality evaluators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.037457Z"},"links":{"cited_paper":"/paper/2501.17202","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b9636c209135e9c5e32aca352112ebac188db9643e720c1a4e3c8ffc75c6602c","observation_id":"ffd1783b-d96b-45b3-875b-cd32e9e3f7cc","resolution":{"observed_at":"2026-08-07T11:28:47.037457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:47.131408Z","title":"Multi-modal generative ai: Multi-modal llm, diffusion and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.131408Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:ace1c15c0573e72f557c806a4f780d40d1a3a629a8a6570365fdae4fccc5b9a9","observation_id":"50a4e804-f797-4395-8160-ed86c96a8184","resolution":{"observed_at":"2026-08-07T11:28:47.131408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08486","last_updated":"2022-12-16T14:00:26Z","snapshot_observed_at":"2026-08-04T00:47:45.521029Z","submitted_at":"2022-12-16T14:00:26Z","title":"BLASER: A Text-Free Speech-to-Speech Translation Evaluation Metric","version":1},"cited_work":{"arxiv_id":"2212.08486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.08486","snapshot_observed_at":"2026-08-07T11:29:09.112333Z","title":"BLASER: A Text-Free Speech-to-Speech Translation Evaluation Metric","venue":"cs.CL","work_id":"3ad6c2d1-82f4-460e-9a37-8782c243736f","year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.272554Z"},"links":{"cited_paper":"/paper/2212.08486","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b6c0c5f6fbf2e47d9f19097734e93f36d3a4312935423d2ac2b890f2d870b3cd","observation_id":"cfb96779-2c01-4c02-8f85-b926d2500d09","resolution":{"observed_at":"2026-08-07T11:29:09.300688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:47.395714Z","title":"Opportunities and challenges of diffusion models for generative ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.395714Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:4177911a42586f719c5ca0d6024bc3a8a9186beb03493b2beb2aa94e495cd9b2","observation_id":"e0a91960-f798-408d-9327-e419336192c6","resolution":{"observed_at":"2026-08-07T11:28:47.395714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06474","last_updated":"2022-11-11T20:21:38Z","snapshot_observed_at":"2026-08-03T02:00:26.609861Z","submitted_at":"2022-11-11T20:21:38Z","title":"Speech-to-Speech Translation For A Real-world Unwritten Language","version":1},"cited_work":{"arxiv_id":"2211.06474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.06474","snapshot_observed_at":"2026-08-07T11:29:08.840773Z","title":"Speech-to-Speech Translation For A Real-world Unwritten Language","venue":"cs.CL","work_id":"e75b5cf0-7e17-4dd4-a676-85d2f70468dd","year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.506438Z"},"links":{"cited_paper":"/paper/2211.06474","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:9a2176b3f3dc72e1f37fa0278fdedc310d931fa3f4593612dc02a2e37adab01b","observation_id":"d123d686-eb6c-44ea-b2e1-1c3d8cda3ec5","resolution":{"observed_at":"2026-08-07T11:29:08.984427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18680","last_updated":"2024-11-06T10:27:05Z","snapshot_observed_at":"2026-08-03T23:01:12.075714Z","submitted_at":"2024-09-27T12:06:53Z","title":"Beyond Single-Audio: Advancing Multi-Audio Processing in Audio Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18680","snapshot_observed_at":"2026-08-07T11:28:47.620955Z","title":"Beyond single-audio: Advancing multi-audio processing in audio large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.620955Z"},"links":{"cited_paper":"/paper/2409.18680","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:8ed346869caf6c2b89828f16d3f9f106abc41b02a2dbf661005e924535569710","observation_id":"45848d7e-2c1f-42fb-ad7b-5181aebd560e","resolution":{"observed_at":"2026-08-07T11:28:47.620955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11026","last_updated":"2025-07-30T05:08:14Z","snapshot_observed_at":"2026-08-07T17:05:12.555600Z","submitted_at":"2025-03-14T02:48:43Z","title":"MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation","version":2},"cited_work":{"arxiv_id":"2503.11026","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.11026","snapshot_observed_at":"2026-08-07T11:29:08.556163Z","title":"MAVFlow: Preserving Paralinguistic Elements with Conditional Flow Matching for Zero-Shot AV2AV Multilingual Translation","venue":"eess.AS","work_id":"371d0a29-aec7-4185-8710-ff75e87e053f","year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.738849Z"},"links":{"cited_paper":"/paper/2503.11026","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:6e88ecc3cf135b500cc8b0a0b42f1c8534993c610748d33a873e868f0027b87e","observation_id":"f85aa4a1-dd53-4ecd-855f-9464586307fb","resolution":{"observed_at":"2026-08-07T11:29:08.710391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:47.864422Z","title":"V2sflow: Video-to-speech generation with speech decomposition and rectified flow","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.864422Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f8de28723884f1e6349ac2700b0479af3ce44d981ffbba5b35b03c34560967ae","observation_id":"4cd6b87b-9d0a-4756-914e-c97a4f230078","resolution":{"observed_at":"2026-08-07T11:28:47.864422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T11:28:47.996341Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:47.996341Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:13a500212e9bced5ca387ee6c38d0dd90e4f686c2e1c2424994449b1ffd3ebc7","observation_id":"ed150bb4-fd36-4975-ba85-8a9f662e12e9","resolution":{"observed_at":"2026-08-07T11:28:47.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T11:28:48.113094Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.113094Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:aaa6453b3f2b651c3896673978d202c21bc4eb2a5d19d3636ab5ad30a97b9a86","observation_id":"70e5c870-ac9f-41f7-bfa6-0dd9bddde940","resolution":{"observed_at":"2026-08-07T11:28:48.113094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:48.258509Z","title":"Diffusion models in vision: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.258509Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:dbe4c48b842495bfa11d1d23f13a809a1923552175bbb97cda9806136982d021","observation_id":"b4b26d0b-0a3d-4474-ab62-54688b122d44","resolution":{"observed_at":"2026-08-07T11:28:48.258509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05547","last_updated":"2024-06-08T18:34:28Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:34:28Z","title":"Exploring the Benefits of Tokenization of Discrete Acoustic Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05547","snapshot_observed_at":"2026-08-07T11:28:48.396469Z","title":"Exploring the benefits of tokenization of discrete acoustic units","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.396469Z"},"links":{"cited_paper":"/paper/2406.05547","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:a3998b0658c102d33d6de2e7ef43c392bd45a551722c053ac8b85fee69b2e411","observation_id":"499a2de5-a6d6-49b1-9bbe-b68e66bb5ecb","resolution":{"observed_at":"2026-08-07T11:28:48.396469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-05T17:03:13.874637Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04476","snapshot_observed_at":"2026-08-07T11:28:48.510861Z","title":"Adiff: Explaining audio difference using natural language","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.510861Z"},"links":{"cited_paper":"/paper/2502.04476","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:579f4d4f866baeef116847100417fadb2f7b97c291066c279b0962566d73a051","observation_id":"aceb2984-3db4-4261-9616-02507bf01c93","resolution":{"observed_at":"2026-08-07T11:28:48.510861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:48.632625Z","title":"French- fulfulde textless and cascading speech translation: Towards a dual architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.632625Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:5a1758c68c8d23c442e3364b3bd1ecb7f4a55a9a8fb443f761b19e790194e31c","observation_id":"ab55b59d-fcab-4bd1-88ca-d70844f0a013","resolution":{"observed_at":"2026-08-07T11:28:48.632625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15405","last_updated":"2024-11-06T21:18:59Z","snapshot_observed_at":"2026-07-06T15:32:49.322000Z","submitted_at":"2023-05-24T17:59:05Z","title":"Textless Speech-to-Speech Translation With Limited Parallel Data","version":3},"cited_work":{"arxiv_id":"2305.15405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15405","snapshot_observed_at":"2026-08-07T11:29:08.257674Z","title":"Textless Speech-to-Speech Translation With Limited Parallel Data","venue":"cs.CL","work_id":"115120e0-0fff-4143-857a-d09a5bfd3d3b","year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.766848Z"},"links":{"cited_paper":"/paper/2305.15405","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b0566c45eb9f21a1f4c086c66d7e83271db7c1e5126f638845ffd6d4e306aa98","observation_id":"d1013065-7116-412b-8efe-45c6e9a37755","resolution":{"observed_at":"2026-08-07T11:29:08.377385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02982","last_updated":"2023-06-13T15:15:17Z","snapshot_observed_at":"2026-07-06T15:38:43.389873Z","submitted_at":"2023-06-05T15:53:15Z","title":"PolyVoice: Language Models for Speech to Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02982","snapshot_observed_at":"2026-08-07T11:28:48.876266Z","title":"Polyvoice: Language models for speech to speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.876266Z"},"links":{"cited_paper":"/paper/2306.02982","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:5fd9e25d3b6f5f064d776b86c80c97e3e4c4339385416ce1a4abf409fc9cde7c","observation_id":"a17fd686-12f2-4ec2-b5a1-979ad80e7a4b","resolution":{"observed_at":"2026-08-07T11:28:48.876266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-02T08:46:39.076208Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-07T11:28:48.957781Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:48.957781Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:a812621455ea27ba252402ea17c5b24f68431b7ecad7cf21805d3f2139ee26e0","observation_id":"0ed51a5e-b3e9-4b28-9310-5c372fc528a5","resolution":{"observed_at":"2026-08-07T11:28:48.957781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18332","last_updated":"2024-07-08T08:53:26Z","snapshot_observed_at":"2026-07-06T18:52:07.765911Z","submitted_at":"2024-07-08T08:53:26Z","title":"Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":"2407.18332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.18332","snapshot_observed_at":"2026-08-07T11:29:07.925172Z","title":"Analyzing Speech Unit Selection for Textless Speech-to-Speech Translation","venue":"eess.AS","work_id":"2ee17553-074e-4a0e-bc51-e926bff37517","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.074528Z"},"links":{"cited_paper":"/paper/2407.18332","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:6524b3f9145da2e0753a32acf2b8a7359e52673815da898a3ee72e5a38df04ea","observation_id":"4826969a-6b2d-429a-8547-47185ea11b6d","resolution":{"observed_at":"2026-08-07T11:29:08.081160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.184864Z","title":"Enhancing expressivity transfer in textless speech-to-speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.184864Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:be465d6fd9f40d3b33bf51c0359fe9a6945a8342d402d9c0fac35a95fd699f02","observation_id":"0eac4a58-04d9-427d-bad9-8e49c446503e","resolution":{"observed_at":"2026-08-07T11:28:49.184864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.309000Z","title":"Towards massive parallel corpus creation for hausa-to-english machine translation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.309000Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7f7a1c5c0b84b5c0d66acd5b69cc28b9478dd495fc7891a90775b0c2d96752f1","observation_id":"bb15fd2f-4b1b-47a7-8885-81dd702209da","resolution":{"observed_at":"2026-08-07T11:28:49.309000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.422521Z","title":"Auditory-visual perception of speech","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.422521Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:5491f94da9a635bd873a11395bf3a3214ff64a27d202f6d674ed023102117b1e","observation_id":"43061353-529b-4bd1-b9e2-4e95189b84e7","resolution":{"observed_at":"2026-08-07T11:28:49.422521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.526893Z","title":"Cascade or direct speech translation? a case study","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.526893Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:e406cf092f1b1a39a276c8b5b3acbefd0e8b6bb5993f018a2ed7d1686ef98f16","observation_id":"91bd5a83-bffa-449d-ab01-199c8b972f30","resolution":{"observed_at":"2026-08-07T11:28:49.526893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07330","last_updated":"2024-06-11T15:00:33Z","snapshot_observed_at":"2026-08-02T07:50:06.611716Z","submitted_at":"2024-06-11T15:00:33Z","title":"CTC-based Non-autoregressive Textless Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07330","snapshot_observed_at":"2026-08-07T11:28:49.651108Z","title":"Ctc-based non-autoregressive textless speech-to-speech translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.651108Z"},"links":{"cited_paper":"/paper/2406.07330","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:2b20d7aa98ef6e746df61dc8f71a3a4fca15419e382d03d6b060f1c5e3dfd5fd","observation_id":"e5b44b4b-c15b-4aa9-b989-426f7342c4ab","resolution":{"observed_at":"2026-08-07T11:28:49.651108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07289","last_updated":"2024-06-11T14:17:12Z","snapshot_observed_at":"2026-07-06T18:28:55.652937Z","submitted_at":"2024-06-11T14:17:12Z","title":"Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?","version":1},"cited_work":{"arxiv_id":"2406.07289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07289","snapshot_observed_at":"2026-08-07T11:29:07.610253Z","title":"Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?","venue":"cs.CL","work_id":"afb7e692-6be3-4d25-84ea-220bec1a1f0b","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.736451Z"},"links":{"cited_paper":"/paper/2406.07289","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:521865733437fc3f8482de713466c29196c851911d4d4efdbd9f24124d7fdef7","observation_id":"b5a56457-cccd-405c-a2f8-3d656195576b","resolution":{"observed_at":"2026-08-07T11:29:07.737070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.823671Z","title":"Generative learning of the solution of parametric partial differential equations using guided diffusion models and virtual observations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.823671Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:c3dd2a6575a1676a589eac5434fb480b3b03083b715bb976c50880d3564367f2","observation_id":"aef21d98-ff4e-4d1a-b6bc-c81f4bd7ba12","resolution":{"observed_at":"2026-08-07T11:28:49.823671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:49.953797Z","title":"Unsupervised speech technology for low-resource languages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:49.953797Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:03a053772bbbfb0e99035f108b9c424485f50f05dc90006c6c37b643f6c3e242","observation_id":"2623a34d-a06c-4916-b297-75ecf9cc5921","resolution":{"observed_at":"2026-08-07T11:28:49.953797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.060496Z","title":"Speech-to-speech translation","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.060496Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:c02d8e4cc9ba919ac2c4d9b4539e711dccd9057fdadc0570f5587e7fed86da0b","observation_id":"0da42731-d665-45ed-a794-9f9946f11ffa","resolution":{"observed_at":"2026-08-07T11:28:50.060496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07616","last_updated":"2024-04-11T10:08:34Z","snapshot_observed_at":"2026-07-06T17:58:43.506575Z","submitted_at":"2024-04-11T10:08:34Z","title":"Audio Dialogues: Dialogues dataset for audio and music understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07616","snapshot_observed_at":"2026-08-07T11:28:50.157071Z","title":"Audio dialogues: Dialogues dataset for audio and music understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.157071Z"},"links":{"cited_paper":"/paper/2404.07616","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:a8d34f6ae600f617ed2d76c837f530aacfbe379338ddcb0e43e20a41da39876d","observation_id":"6e31a667-aa47-4940-9947-2d4e8bbd8fba","resolution":{"observed_at":"2026-08-07T11:28:50.157071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08655","last_updated":"2023-07-17T17:12:44Z","snapshot_observed_at":"2026-07-06T15:54:54.826581Z","submitted_at":"2023-07-17T17:12:44Z","title":"Multilingual Speech-to-Speech Translation into Multiple Target Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08655","snapshot_observed_at":"2026-08-07T11:28:50.237516Z","title":"Multilingual speech-to-speech translation into multiple target languages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.237516Z"},"links":{"cited_paper":"/paper/2307.08655","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:67ef08d46623f26dded2ce59f8fdaf5bff816dd42594a2ac6bd74849b7cdccb0","observation_id":"60b14585-6067-444f-a72e-8091a3e33557","resolution":{"observed_at":"2026-08-07T11:28:50.237516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.328623Z","title":"Joint audio and speech understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.328623Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:af378c053aba2b657adb1e471c7612210710a12136ae8285b3b2591cf3214638","observation_id":"f8cd0254-62a1-47a9-9fda-2f42e927c5f1","resolution":{"observed_at":"2026-08-07T11:28:50.328623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.423111Z","title":"Tibetan–chinese speech-to-speech translation based on dis- crete units","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.423111Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:d4f9842364360b77701c253269cc61c5e776bba9e564580a1f0bb10c2bb9c84c","observation_id":"39fa5909-c21d-46eb-a46f-2ee384003423","resolution":{"observed_at":"2026-08-07T11:28:50.423111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.514977Z","title":"Recent advances in discrete speech tokens: A review","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.514977Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:befab95df08a8b83ac72c662a4ad4308f718c3dddc1fcf9f1c234b0ca8901c0f","observation_id":"95e3ae8a-f5a0-4b8e-b1b8-f29255c55b25","resolution":{"observed_at":"2026-08-07T11:28:50.514977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14453","last_updated":"2024-11-13T13:01:21Z","snapshot_observed_at":"2026-08-07T13:22:02.333885Z","submitted_at":"2024-11-13T13:01:21Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","version":1},"cited_work":{"arxiv_id":"2411.14453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14453","snapshot_observed_at":"2026-08-07T11:29:07.343009Z","title":"Direct Speech-to-Speech Neural Machine Translation: A Survey","venue":"cs.CL","work_id":"ad1960c3-d599-43e3-868b-b6467aae0bf7","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.617509Z"},"links":{"cited_paper":"/paper/2411.14453","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:17becb48417ed1ca12e50f23ac025e0ab8ab89748de8f46fafea23cbddb5d2c1","observation_id":"666aa822-1a2a-4348-bae2-6e5fe90247a1","resolution":{"observed_at":"2026-08-07T11:29:07.434642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.713865Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.713865Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b0c14f0c2e33f96cf6b6295e863a3296252c647000d5b10d83cbd4b564fcddb8","observation_id":"2022b7aa-ae5c-427c-a578-058301bac9b2","resolution":{"observed_at":"2026-08-07T11:28:50.713865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.772569Z","title":"Physics-inspired approaches in generative diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.772569Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:68f3dc48d57c96c8f6ec884567352c18ee2c307a3cdce92c933fe6cd09b1f683","observation_id":"fd866ec3-b451-408d-b0a0-8748559e606d","resolution":{"observed_at":"2026-08-07T11:28:50.772569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12477","last_updated":"2024-06-15T14:13:54Z","snapshot_observed_at":"2026-07-06T16:35:27.763870Z","submitted_at":"2023-10-19T05:31:45Z","title":"Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks","version":2},"cited_work":{"arxiv_id":"2310.12477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12477","snapshot_observed_at":"2026-08-07T11:29:07.127706Z","title":"Exploring In-Context Learning of Textless Speech Language Model for Speech Classification Tasks","venue":"eess.AS","work_id":"5727a862-6705-4bc1-91eb-ceb2a3fa9096","year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.849055Z"},"links":{"cited_paper":"/paper/2310.12477","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:6a0ccb6fa03ca53e813f5f8053819cd2b23d61c6c084aaec8fc5a1ff091af65a","observation_id":"f355817d-0e17-4169-9cbd-8afe0eb53b49","resolution":{"observed_at":"2026-08-07T11:29:07.249632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:50.906902Z","title":"Chain-of-thought prompting for speech translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.906902Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b6719598b0771ae3143461b0fd27136c9097d251ff10639dca8d1eb292a012c5","observation_id":"fbc096ac-803e-475f-9254-687f59be384f","resolution":{"observed_at":"2026-08-07T11:28:50.906902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12523","last_updated":"2023-03-02T09:17:01Z","snapshot_observed_at":"2026-07-06T13:13:40.650733Z","submitted_at":"2022-05-25T06:34:14Z","title":"TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation","version":2},"cited_work":{"arxiv_id":"2205.12523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.12523","snapshot_observed_at":"2026-08-07T11:29:06.951252Z","title":"TranSpeech: Speech-to-Speech Translation With Bilateral Perturbation","venue":"cs.CL","work_id":"4fc5e5b0-220b-40f1-94af-c6ddbaa33396","year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:50.968083Z"},"links":{"cited_paper":"/paper/2205.12523","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:327ed901ffadb01d0e1e187d4d198e742abb4e7e0e34ee430874a0b91ff8bbfb","observation_id":"a16b2aec-5c45-419e-bdd6-f59e89cb8817","resolution":{"observed_at":"2026-08-07T11:29:07.050233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02733","last_updated":"2024-06-04T19:22:13Z","snapshot_observed_at":"2026-07-06T18:25:31.706930Z","submitted_at":"2024-06-04T19:22:13Z","title":"Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":"2406.02733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02733","snapshot_observed_at":"2026-08-07T11:29:06.804135Z","title":"Textless Acoustic Model with Self-Supervised Distillation for Noise-Robust Expressive Speech-to-Speech Translation","venue":"cs.CL","work_id":"b7cfe620-503e-40d3-aa55-628290008d40","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.039084Z"},"links":{"cited_paper":"/paper/2406.02733","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b05bd4f1d875476f96a613a8a9f9b60ce3db3e0389acee058fa972f9792532d3","observation_id":"645479fc-6505-4d81-8dc5-c3e9f1e7c109","resolution":{"observed_at":"2026-08-07T11:29:06.877355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:51.104629Z","title":"Massively multi- lingual forced aligner leveraging self-supervised discrete units","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.104629Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:c01616a34c165056d666068cce5319de9a76605057f7d87803c1fcb0f77c4641","observation_id":"4f7aa9c0-3d17-439d-b26a-4b34f3d7c969","resolution":{"observed_at":"2026-08-07T11:28:51.104629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10593","last_updated":"2022-04-22T09:33:31Z","snapshot_observed_at":"2026-08-06T02:51:31.280292Z","submitted_at":"2022-04-22T09:33:31Z","title":"LibriS2S: A German-English Speech-to-Speech Translation Corpus","version":1},"cited_work":{"arxiv_id":"2204.10593","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.10593","snapshot_observed_at":"2026-08-07T11:29:06.509595Z","title":"LibriS2S: A German-English Speech-to-Speech Translation Corpus","venue":"cs.CL","work_id":"9658dc92-648b-4c05-9701-3b1fc5fac63f","year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.219694Z"},"links":{"cited_paper":"/paper/2204.10593","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:8e75a4f5853245622c79d4f3e28d4035235f320f0cc8a06bfb39c9dad8261588","observation_id":"411f20dd-1332-4924-ac1f-3640152ea1a7","resolution":{"observed_at":"2026-08-07T11:29:06.641946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T11:28:51.286122Z","title":"Wavchat: A survey of spoken dialogue models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.286122Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:1fcd28e83c0e2e22cb74809d925f66214cd63b995b12f44f543329ebe47b175b","observation_id":"b3c742b7-aa8e-4ea6-b906-76cf35b79278","resolution":{"observed_at":"2026-08-07T11:28:51.286122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07890","last_updated":"2025-09-12T08:50:31Z","snapshot_observed_at":"2026-08-07T17:14:52.317538Z","submitted_at":"2025-03-10T22:15:51Z","title":"Can Generative Geospatial Diffusion Models Excel as Discriminative Geospatial Foundation Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07890","snapshot_observed_at":"2026-08-07T11:28:51.380557Z","title":"Can generative geospatial diffusion models excel as discriminative geospatial foundation models? arXiv preprint arXiv:2503.07890, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.380557Z"},"links":{"cited_paper":"/paper/2503.07890","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:c33875d547d9e83d41e8eb86cb6d2de03296523ad793cf8ec76629d842f1bff7","observation_id":"73b92d89-70e8-41c1-936a-f94529374e76","resolution":{"observed_at":"2026-08-07T11:28:51.380557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:51.433996Z","title":"Listra automatic speech translation: English to lingala case study","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.433996Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:413c0f3e355081dd1c0623a4d8a344059d0a782cbde28451b8af7119edcf1cdc","observation_id":"2b4fde17-57c6-4b7f-b51f-693b03ae020e","resolution":{"observed_at":"2026-08-07T11:28:51.433996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:51.582236Z","title":"Gdplan: Generative network planning via graph diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.582236Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b187a0f3134da6a74e4a33ffabb20d599b374dba2f9e8c934d51216b0636e02c","observation_id":"8164b2a9-f011-4b13-8074-1a8b4d7bb00d","resolution":{"observed_at":"2026-08-07T11:28:51.582236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15967","last_updated":"2024-02-25T03:03:34Z","snapshot_observed_at":"2026-08-06T14:20:14.073867Z","submitted_at":"2024-02-25T03:03:34Z","title":"Direct Punjabi to English speech translation using discrete units","version":1},"cited_work":{"arxiv_id":"2402.15967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15967","snapshot_observed_at":"2026-08-07T11:29:06.149244Z","title":"Direct Punjabi to English speech translation using discrete units","venue":"cs.CL","work_id":"432162d8-9364-443b-9f17-c5ffc7bcacb7","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.726334Z"},"links":{"cited_paper":"/paper/2402.15967","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:15db8414f7db8693f7b5a0f757754bdfec7ae075a7e42b2b018835ddf77210f8","observation_id":"ffa65f22-3545-4468-a606-d1383c7257be","resolution":{"observed_at":"2026-08-07T11:29:06.313102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:51.872948Z","title":"Textless unit-to-unit training for many- to-many multilingual speech-to-speech translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.872948Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:db446ccee461b0e9cb528b8837568c8e2bca0214777514d460f97bfa6f35fd55","observation_id":"47a8994c-a3da-440a-93fb-7ce5beed79f2","resolution":{"observed_at":"2026-08-07T11:28:51.872948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.075185Z","title":"Phi dm-dialog: an experimental speech-to-speech dialog translation system","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.075185Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:cf2e92acadb4800009dd416dc12a444b41d93e338857a0f212a5a2396f43a8be","observation_id":"f1df9749-84f9-43fa-a302-e888b5d5135b","resolution":{"observed_at":"2026-08-07T11:28:52.075185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03382","last_updated":"2025-02-26T09:31:58Z","snapshot_observed_at":"2026-08-07T11:17:00.922804Z","submitted_at":"2025-02-05T17:18:55Z","title":"High-Fidelity Simultaneous Speech-To-Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03382","snapshot_observed_at":"2026-08-07T11:28:52.222146Z","title":"High-fidelity simultaneous speech-to-speech translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.222146Z"},"links":{"cited_paper":"/paper/2502.03382","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:289d228431cfcb6b0ce00d9b503e1877ea3c893a9b33a5c5f6c53b69baebb291","observation_id":"e1bcde44-36e0-4eca-ae94-34ec2c0fdf4f","resolution":{"observed_at":"2026-08-07T11:28:52.222146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.338122Z","title":"Janus-iii: Speech-to-speech translation in multiple languages","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.338122Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:d028a03e8f03135e8380f26229051baf31d82f9df9c6fb449f5081986a037e84","observation_id":"ee857ae4-18f4-4465-91a5-e7e86832f1ea","resolution":{"observed_at":"2026-08-07T11:28:52.338122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08352","last_updated":"2022-05-04T18:16:38Z","snapshot_observed_at":"2026-08-06T07:54:31.859843Z","submitted_at":"2021-12-15T18:56:35Z","title":"Textless Speech-to-Speech Translation on Real Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08352","snapshot_observed_at":"2026-08-07T11:28:52.430942Z","title":"Textless speech-to-speech translation on real data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.430942Z"},"links":{"cited_paper":"/paper/2112.08352","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:9f234dd5f40be585603a44c92cf41983758b6b2566bca37f2d39de7586960e3b","observation_id":"a544d151-2432-4379-afe7-49bd57a39dac","resolution":{"observed_at":"2026-08-07T11:28:52.430942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.488633Z","title":"Video diffusion models are strong video inpainter","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.488633Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:30c2213cb05e135d1df75339ffafad573070fc101e946c065a6840bd5586935a","observation_id":"7bd8c795-7df6-4383-9fdd-0cfa0c5444aa","resolution":{"observed_at":"2026-08-07T11:28:52.488633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.561720Z","title":"Speech proportion and accuracy in simultaneous interpretation from english into korean","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.561720Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:8f1f8ba6a3f50410ef789b3df844b51ec96cd115244339ffed777ef79ebd8a98","observation_id":"6f212478-dc0f-4540-8470-5ec1cb2360fd","resolution":{"observed_at":"2026-08-07T11:28:52.561720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.627257Z","title":"Diffusion models for audio restoration: A review [special issue on model-based and data-driven audio signal processing]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.627257Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:3ddd611840fc1ddbda68f0aa6be34af1be532638bff0761458f3b4c996288a5e","observation_id":"c5462798-f80a-43c7-a9e3-edd0a298c7b6","resolution":{"observed_at":"2026-08-07T11:28:52.627257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.698356Z","title":"Conditional diffusion model for missing value imputation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.698356Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:7aec5c42d1291b1c47f1166674b64c4c100c87eff4aaf3ed86fc61aab5d773d1","observation_id":"2bfdd863-1ecb-41df-8902-eb01fd97d21a","resolution":{"observed_at":"2026-08-07T11:28:52.698356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14971","last_updated":"2025-08-05T04:59:44Z","snapshot_observed_at":"2026-07-06T19:36:19.567469Z","submitted_at":"2024-10-19T04:29:03Z","title":"BrainECHO: Semantic Brain Signal Decoding through Vector-Quantized Spectrogram Reconstruction for Whisper-Enhanced Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14971","snapshot_observed_at":"2026-08-07T11:28:52.756373Z","title":"Brainecho: Semantic brain signal decoding through vector-quantized spectrogram reconstruction for whisper-enhanced text generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.756373Z"},"links":{"cited_paper":"/paper/2410.14971","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:47a05a1e95b794e7d6de34266c6b7e4b72cb1cfe53cba12226640b80a6af957e","observation_id":"69f88707-5b02-41bd-b2e2-f5ae64cbdcff","resolution":{"observed_at":"2026-08-07T11:28:52.756373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17239","last_updated":"2025-02-24T15:16:34Z","snapshot_observed_at":"2026-08-07T17:53:08.473463Z","submitted_at":"2025-02-24T15:16:34Z","title":"Baichuan-Audio: A Unified Framework for End-to-End Speech Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17239","snapshot_observed_at":"2026-08-07T11:28:52.822450Z","title":"Baichuan-audio: A unified framework for end-to-end speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.822450Z"},"links":{"cited_paper":"/paper/2502.17239","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:06956f9660cb2a630106e7de5f92fb116d296588c98bb984a9106c4edd1d47da","observation_id":"a861450a-14e7-4ae6-b631-4ebdec81cd59","resolution":{"observed_at":"2026-08-07T11:28:52.822450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:52.889256Z","title":"Textless direct speech-to-speech translation with discrete speech representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.889256Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:eb600594c578771a8c8a1c08d919c6a0e27aebf7319e1b53009c79e77ba1b397","observation_id":"c7976c58-03ca-45cc-b81f-0ef8ea4a3323","resolution":{"observed_at":"2026-08-07T11:28:52.889256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00765","last_updated":"2025-04-13T12:50:16Z","snapshot_observed_at":"2026-07-06T20:15:27.167354Z","submitted_at":"2025-01-01T07:55:15Z","title":"Beyond Words: AuralLLM and SignMST-C for Sign Language Production and Bidirectional Accessibility","version":2},"cited_work":{"arxiv_id":"2501.00765","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00765","snapshot_observed_at":"2026-08-07T11:29:05.882754Z","title":"Beyond Words: AuralLLM and SignMST-C for Sign Language Production and Bidirectional Accessibility","venue":"cs.CV","work_id":"d8e5f365-2cbb-4ad8-b05e-60c2f32027e9","year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:52.948623Z"},"links":{"cited_paper":"/paper/2501.00765","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:c46eaa8ea8d613be08bbb9cc7cbc480ee0a9c112094d4ada259e5fb0ea260a65","observation_id":"396661f3-0e18-4ef1-a595-31a025022a83","resolution":{"observed_at":"2026-08-07T11:29:06.009246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01834","last_updated":"2025-05-27T16:17:52Z","snapshot_observed_at":"2026-07-06T19:44:38.954993Z","submitted_at":"2024-11-04T06:07:53Z","title":"Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01834","snapshot_observed_at":"2026-08-07T11:28:53.047690Z","title":"Align-slm: Textless spoken language models with reinforcement learning from ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.047690Z"},"links":{"cited_paper":"/paper/2411.01834","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:44bd00a9ea9c3158bcb2271f7c3e98af8985d8885e692ef5d34d5db7ecdabd35","observation_id":"ccef7ffc-1061-4497-8b00-b6dc666de485","resolution":{"observed_at":"2026-08-07T11:28:53.047690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.113989Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.113989Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:1bca64f68f4423bbc8e582de33b498cd7239fd7687ec02258d7304b7745e7300","observation_id":"70b4be9b-ed03-4861-b1d3-1846e98fd97e","resolution":{"observed_at":"2026-08-07T11:28:53.113989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.190421Z","title":"Handdiffuse: generative controllers for two-hand interactions via diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.190421Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:87497f7576b57f418bd973da56d81b22cd6c60b6a7e5842c2d20deb26f3cf9b2","observation_id":"79af8f6c-b061-4ac3-88c1-3a856ac09d70","resolution":{"observed_at":"2026-08-07T11:28:53.190421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-07T19:57:13.037270Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-07T11:28:53.249841Z","title":"A preliminary exploration with gpt-4o voice mode","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.249841Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:d7adc0e199d4b6c2ef0338cce0666634e23b9594702f27a67b2b2fee6b326510","observation_id":"0222dac1-65b2-4a42-b3f4-ba5a3b496eda","resolution":{"observed_at":"2026-08-07T11:28:53.249841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.332770Z","title":"Recent highlights in multilingual and multimodal speech translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.332770Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:93011fad3e542630ae3fc67e7b9d6ed1b304c71d7d8f7f667e838afa53dc3ed7","observation_id":"550e152a-e5dc-42bc-8b1f-74d8a62b5a70","resolution":{"observed_at":"2026-08-07T11:28:53.332770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.418689Z","title":"Speech-to-speech low-resource translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.418689Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:5bb1683d30bb60d7c70b23f06037795b96c5426cd1aa5d23d1ba87603ccec2c2","observation_id":"a738617c-b7fd-458e-825c-4d7de2be9be0","resolution":{"observed_at":"2026-08-07T11:28:53.418689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.480148Z","title":"Listening and seeing again: Generative error correction for audio-visual speech recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.480148Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:196727f9da469315596af15701b1beec6f29c562284ae59572561d2967c5f99e","observation_id":"1b92ec96-557f-43f8-a985-c861c919bd5f","resolution":{"observed_at":"2026-08-07T11:28:53.480148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00805","last_updated":"2025-01-01T11:11:07Z","snapshot_observed_at":"2026-07-06T20:15:27.167354Z","submitted_at":"2025-01-01T11:11:07Z","title":"SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00805","snapshot_observed_at":"2026-08-07T11:28:53.542723Z","title":"Slide: Integrating speech language model with llm for spontaneous spoken dialogue generation.arXiv preprint arXiv:2501.00805, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.542723Z"},"links":{"cited_paper":"/paper/2501.00805","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:1ac87c0a550eef9d4c1ec7aa47be622da080dc49db2d0a855e7f91f1aa0aaef2","observation_id":"497f7294-6426-4c88-8ee4-a722d4b124f6","resolution":{"observed_at":"2026-08-07T11:28:53.542723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.615822Z","title":"Llamapartialspoof: An llm-driven fake speech dataset simulating disinformation generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.615822Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:057035add1714893b14352600fe3390eab103427f1693f10c6fdd579b8d1af73","observation_id":"51da33f3-43af-4f58-b49d-4360c75d864c","resolution":{"observed_at":"2026-08-07T11:28:53.615822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.691843Z","title":"Build llm-based zero-shot streaming tts system with cosyvoice","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.691843Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:fabc725a81cc619481ad8f18f7141723f0f2279c9be803296223869d7a2db8ce","observation_id":"d8a008de-eb3f-46d5-a025-6441456e2a81","resolution":{"observed_at":"2026-08-07T11:28:53.691843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:53.754082Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.754082Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:0779889e561aa39d86ef10b7db269804bb20ebfbf5fe6250c1f94ea6b9f17ea9","observation_id":"7da2b580-0764-4db3-813a-999550cfc9a4","resolution":{"observed_at":"2026-08-07T11:28:53.754082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04877","last_updated":"2025-01-08T23:21:43Z","snapshot_observed_at":"2026-08-05T22:30:01.806600Z","submitted_at":"2025-01-08T23:21:43Z","title":"Real-Time Textless Dialogue Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04877","snapshot_observed_at":"2026-08-07T11:28:53.813975Z","title":"Real-time textless dialogue generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.813975Z"},"links":{"cited_paper":"/paper/2501.04877","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:4184043bac2d71a7ca3c8c02829b79c6c3935e1a4f2f3a8ae1f12a8d0a33e1e2","observation_id":"7fa3d4a9-2460-499f-a34e-4f104d4c58c9","resolution":{"observed_at":"2026-08-07T11:28:53.813975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15814","last_updated":"2025-05-22T16:55:59Z","snapshot_observed_at":"2026-08-07T18:04:26.690487Z","submitted_at":"2025-02-19T17:21:15Z","title":"Slamming: Training a Speech Language Model on One GPU in a Day","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15814","snapshot_observed_at":"2026-08-07T11:28:53.898225Z","title":"Slamming: Training a speech language model on one gpu in a day","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.898225Z"},"links":{"cited_paper":"/paper/2502.15814","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:8fb8a7a0e0020795279c57a3199ac63281b5c91ed86274749c3bb8cabb50fb53","observation_id":"3cb01864-40b8-4d19-ae41-18a246831544","resolution":{"observed_at":"2026-08-07T11:28:53.898225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10999","last_updated":"2025-05-23T10:37:01Z","snapshot_observed_at":"2026-07-06T19:16:36.688367Z","submitted_at":"2024-09-17T09:04:03Z","title":"Enhancing Low-Resource Language and Instruction Following Capabilities of Audio Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10999","snapshot_observed_at":"2026-08-07T11:28:53.960789Z","title":"Enhancing low-resource language and instruction following capabilities of audio language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.960789Z"},"links":{"cited_paper":"/paper/2409.10999","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:e10b2fee3fc6b3d7a4a09f776a9b283b5976bf955b76bca8ce650af38f3aeb4d","observation_id":"809a6685-b873-4b14-9281-a9ece5f55ba6","resolution":{"observed_at":"2026-08-07T11:28:53.960789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.025981Z","title":"Make some noise: Towards llm audio reasoning and generation using sound tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.025981Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:fe4d36abdf93245961f98f2ba0dd3758aa481c96d7e04a012a9d9ccd9c2998c8","observation_id":"f53f924c-240e-4287-b891-99000f3eec12","resolution":{"observed_at":"2026-08-07T11:28:54.025981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.074608Z","title":"Deep networks as denoising algorithms: Sample-efficient learning of diffusion models in high-dimensional graphical models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.074608Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:1257a1ba944b05032ac7a73aef297de4859d18bf38a3f80ec7f21eb96c716def","observation_id":"8e180aeb-c0ca-4e72-9646-087233593a67","resolution":{"observed_at":"2026-08-07T11:28:54.074608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.129617Z","title":"Amharic speech recognition for speech translation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.129617Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:137c56d507abdccded2b4918e06a012be5444d357dc91e96d8d20c22a3391946","observation_id":"e4e61795-1735-49f3-b201-3cbf5270002a","resolution":{"observed_at":"2026-08-07T11:28:54.129617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.215355Z","title":"Parrot: Autoregressive spoken dialogue language modeling with decoder-only transform- ers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.215355Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:f9b89f5ac5a6091e55a83a3a405a6092c9cc603ab90f2de3f04527e9f1d0fdff","observation_id":"85a5e050-475a-4d8f-a090-e283bb7612b0","resolution":{"observed_at":"2026-08-07T11:28:54.215355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.281049Z","title":"Towards to a direct speech to speech for endangered languages in africa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.281049Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:b171aec81cef24273ad7f27cd8badbbb30970a3a612c1c828e22b6db8d1c507c","observation_id":"beb0db37-1d76-4902-a215-7357bd88f8eb","resolution":{"observed_at":"2026-08-07T11:28:54.281049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00374","last_updated":"2025-02-01T09:24:32Z","snapshot_observed_at":"2026-07-06T20:29:31.116975Z","submitted_at":"2025-02-01T09:24:32Z","title":"A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":"2502.00374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00374","snapshot_observed_at":"2026-08-07T11:29:05.679080Z","title":"A Unit-based System and Dataset for Expressive Direct Speech-to-Speech Translation","venue":"cs.CL","work_id":"41404120-680b-4594-b952-b3bf72e87136","year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.358626Z"},"links":{"cited_paper":"/paper/2502.00374","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:ad0c85d3396fd0282bd1fb99a1f6c08fd7d39cf9f61ea077b8bc27a3f450f4fe","observation_id":"a87d303b-cef5-4093-a2d6-25f6d4b7597b","resolution":{"observed_at":"2026-08-07T11:29:05.757265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15255","last_updated":"2024-05-31T01:29:27Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T15:39:43Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15255","snapshot_observed_at":"2026-08-07T11:28:54.440358Z","title":"Spoken question an- swering and speech continuation using spectrogram-powered llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.440358Z"},"links":{"cited_paper":"/paper/2305.15255","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:fe5c8d716649519e18d635540f5d7b0ceb48310258b1bbba4492a8465ebdf29c","observation_id":"5d30e757-ba22-422a-b20a-df145a1b26f0","resolution":{"observed_at":"2026-08-07T11:28:54.440358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.514589Z","title":"Towards real-time multilingual multimodal speech-to-speech translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.514589Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:86b4153bebeca892c70fc5a717b0b557df684f4276ae508c5dfa4e53909e7c96","observation_id":"404457b9-4d9e-466b-89c6-ef2fde59496c","resolution":{"observed_at":"2026-08-07T11:28:54.514589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.00768","last_updated":"2020-08-03T10:43:30Z","snapshot_observed_at":"2026-07-06T09:43:58.782799Z","submitted_at":"2020-08-03T10:43:30Z","title":"One Model, Many Languages: Meta-learning for Multilingual Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2008.00768","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.00768","snapshot_observed_at":"2026-08-07T11:29:05.523149Z","title":"One Model, Many Languages: Meta-learning for Multilingual Text-to-Speech","venue":"eess.AS","work_id":"60263e94-27a0-426a-a6a0-424da2a3cf87","year":2020},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.554883Z"},"links":{"cited_paper":"/paper/2008.00768","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:a8b897345095d692fab6b22a76a341106630bd0aca303743bc644941e64db2b9","observation_id":"29d563db-e77d-4365-8701-2432871951b3","resolution":{"observed_at":"2026-08-07T11:29:05.595083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.618527Z","title":"Spoken Language Modeling from Raw Audio","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.618527Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:47a55c4275ede7476289e3eaf08f840abb7153ea988da4ac8b56d7e8db1f8ec9","observation_id":"6f82a242-5629-4085-b9f6-6be3c3184587","resolution":{"observed_at":"2026-08-07T11:28:54.618527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02865","last_updated":"2024-09-03T17:59:50Z","snapshot_observed_at":"2026-07-06T19:10:29.880696Z","submitted_at":"2024-09-03T17:59:50Z","title":"Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling","version":1},"cited_work":{"arxiv_id":"2409.02865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02865","snapshot_observed_at":"2026-08-07T11:29:05.364317Z","title":"Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling","venue":"cs.CL","work_id":"493483a9-f216-4de6-b9e7-9c9c9c0ae700","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.661961Z"},"links":{"cited_paper":"/paper/2409.02865","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:d8be85cec982104d13dd4232524aa1fafe2b0a19d7e020bc7cb2ce88702e0da7","observation_id":"a296a4c6-ff87-4be2-ac85-65a5381ba322","resolution":{"observed_at":"2026-08-07T11:29:05.415512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:28:54.778940Z","title":"Verbmobil: The use of prosody in the linguistic components of a speech understanding system","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.778940Z"},"links":{"citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:a7db7806862355a0cbb9bff8cbd94a646d10894633f4581d23e0bbba0ada981d","observation_id":"04064344-4acb-46fc-8596-1a702b74407a","resolution":{"observed_at":"2026-08-07T11:28:54.778940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23323","last_updated":"2025-06-11T10:02:24Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T09:44:52Z","title":"Phonology-Guided Speech-to-Speech Translation for African Languages","version":3},"cited_work":{"arxiv_id":"2410.23323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23323","snapshot_observed_at":"2026-08-07T11:29:05.202401Z","title":"Phonology-Guided Speech-to-Speech Translation for African Languages","venue":"eess.AS","work_id":"07ab7488-79f5-4f8a-b1f1-23c70883150e","year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.842017Z"},"links":{"cited_paper":"/paper/2410.23323","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:12a1369dae783d826f37472fd8e122b6a21786a611460ace6a3f9a52719c831c","observation_id":"34d099fb-c96f-4cec-85e7-4e0ec50d7b47","resolution":{"observed_at":"2026-08-07T11:29:05.278205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07867","last_updated":"2024-08-02T15:05:47Z","snapshot_observed_at":"2026-08-03T23:11:25.751151Z","submitted_at":"2024-06-12T04:48:36Z","title":"Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07867","snapshot_observed_at":"2026-08-07T11:28:54.880977Z","title":"Let’s go real talk: Spoken dialogue model for face-to-face conversation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.880977Z"},"links":{"cited_paper":"/paper/2406.07867","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:e0fd6508c9a645944372be75e38826a157bfbf77dc87041129c092404f6236ca","observation_id":"899aff8c-87f0-48a0-b348-c1531fdc2af2","resolution":{"observed_at":"2026-08-07T11:28:54.880977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18603","last_updated":"2025-07-10T17:52:43Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-24T18:56:46Z","title":"Long-Form Speech Generation with Spoken Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18603","snapshot_observed_at":"2026-08-07T11:28:54.976320Z","title":"Long-form speech generation with spoken language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:54.976320Z"},"links":{"cited_paper":"/paper/2412.18603","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:39c5e28dd0d5eddf52dc9fe525e81b466b52959fe3a8da7125daa5f52744ce3c","observation_id":"69f5a34b-30cf-4b75-8c5b-9544d342ba84","resolution":{"observed_at":"2026-08-07T11:28:54.976320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T11:21:26.522442Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":17,"verified_fuzzy":0},"total_outbound_references":165},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 165 outbound references and 3 inbound Pith citation observations for arXiv:2506.02443."}