{"as_of":"2026-07-24T22:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d40bd0a095626ca1494eb1f43563d576c4af88236505b579973aa6928f0a53f5","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T07:07:57.800866Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-24T06:31:00.690269+00:00","state":"measured"},{"denominator":58,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T20:46:17.286576Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T07:56:57.816571Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:0afe3d7f08848423c67f1559aae550b10098d30ec6a9a21bfb1d57d69cc04d2d","observation_id":"6d5d19a8-ec8e-4dcf-aaa0-1e930b71436d","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":216,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:e425bbf9bdf6d61a30ec3d7bcc164589e9601513e9183133e574fa18faa37ac7","observation_id":"9b502f34-cb70-408c-bd87-4055a2a6e8ac","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-07-06T16:36:00.246846Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-18T02:29:46.242983Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2310.13289"},"observation_digest":"sha256:a06d3cfa0d73b2b8807bf6b3a7d671d5f108434b398c10ce6843c0bbc6088d20","observation_id":"c4bb07a3-e80a-4bcb-b492-d8e23daf3585","resolution":{"observed_at":"2026-05-18T02:29:46.331117Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-06T17:06:41.478216Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:63355389ea039a9a50edaef17ca61438f1eca1d857407195e003b0741c1401d1","observation_id":"9bae3512-608d-42df-8cee-aca6de0ea124","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:fba5e76151fd07e0a5948a5e80515d96407ce5265833c334385f2072ecf29c8d","observation_id":"d49019ca-98ee-4907-bd2b-a437cbe31600","resolution":{"observed_at":"2026-05-24T00:28:39.570123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2409.18512","last_updated":"2026-04-03T15:54:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T07:46:52Z","title":"Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T20:31:24.494060Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2409.18512"},"observation_digest":"sha256:5c7d5db761afb2d4ab85daee866dc42c04b5e51f62d9d7b978d4443765de7a3e","observation_id":"845d86b3-8597-459f-b362-021156237d04","resolution":{"observed_at":"2026-05-23T20:33:25.633096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-06T19:24:48.032228Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-12T08:13:21.962488Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2410.00037"},"observation_digest":"sha256:3f9926df976c148aa47f788b2c3e29a28f17eef6713f0c1bac02bb68eb5f4eaf","observation_id":"f452b515-2a6f-42d0-8791-4a26ba2947de","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":207,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:9984f6e5114f04e6439a933dd405ff87e24aa9d82a82a2def51a150d028cc983","observation_id":"320f1ed4-37b4-4164-b853-dc288ec0e6fa","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:b02adcf4254e8661ec0186c277ebce5465473ece8e06519ae0e34d981744574f","observation_id":"e14ce1df-f34b-45f9-8f90-b6a18f7055aa","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-07-06T22:05:43.331083Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-19T02:41:52.996457Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2507.23511"},"observation_digest":"sha256:6c1522378cde99b729e4ac7b9af15c3cbf0ec93f2579a5f100e7b57d6b7757e8","observation_id":"56de3074-c47f-4837-8891-9d7bbdc6be87","resolution":{"observed_at":"2026-05-19T02:41:59.639782Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-07-06T22:23:05.533901Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:d718120fd6dc9f07e40d1e6e5a7f139e6986fc07c92f806fa8b015b6c812d727","observation_id":"3401f375-34b5-430d-99ab-5a502de98a97","resolution":{"observed_at":"2026-05-21T22:24:23.486396Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2510.03093","last_updated":"2026-01-23T10:54:04Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-03T15:23:32Z","title":"Revisiting Direct Speech-to-Text Translation with Speech LLMs: Better Scaling than CoT Prompting?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T10:28:16.040337Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2510.03093"},"observation_digest":"sha256:78d2d7dc5787ffef8630c005312f8102dcc9dc6d31691ae3bd48ca3da34ae571","observation_id":"49e37056-2567-47ce-9538-73a740eb7c55","resolution":{"observed_at":"2026-05-18T10:31:14.897207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2511.21517","last_updated":"2026-04-28T09:16:19Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T15:48:04Z","title":"Voice, Bias, and Coreference: An Interpretability Study of Gender in Speech Translation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T04:50:37.457932Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2511.21517"},"observation_digest":"sha256:3e2fc7c196af86629fbe3e5b45b3d516e86db466f6b0b0f3c45d69af6129a839","observation_id":"10c8f76f-1eec-47fe-822c-b669a9b6b5a4","resolution":{"observed_at":"2026-05-17T04:51:31.855446Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2512.10931","last_updated":"2026-05-13T16:04:41Z","snapshot_observed_at":"2026-07-06T22:38:45.907386Z","submitted_at":"2025-12-11T18:57:02Z","title":"Asynchronous Reasoning: Training-Free Interactive Thinking LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2512.10931"},"observation_digest":"sha256:cf0a6107f03c122468ac317046ed605d92037e7cafbdc653c9dfb3dc6792babf","observation_id":"d27a1e66-cd50-43c1-99b8-4b0e0fda3db7","resolution":{"observed_at":"2026-05-16T22:58:38.426506Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2512.16378","last_updated":"2026-04-25T20:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-18T10:21:14Z","title":"Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs","version":4},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-16T21:49:21.785096Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2512.16378"},"observation_digest":"sha256:c4ad6b4bffb3e303d3a5367d0945d1f3ceadbf77a60adb725c2abd784c6688f2","observation_id":"1c982429-0c85-4830-9ecd-da24a5a83063","resolution":{"observed_at":"2026-05-16T21:51:17.782063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2602.01249","last_updated":"2026-04-15T11:24:57Z","snapshot_observed_at":"2026-07-06T22:44:00.266269Z","submitted_at":"2026-02-01T14:18:06Z","title":"Generative AI in Signal Processing Education: An Audio Foundation Model Based Approach","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T08:44:02.494895Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2602.01249"},"observation_digest":"sha256:444c88fbdaa86a2e99f32cf1383963c86d2811fca357a67bbe2da9f5c69a5c1c","observation_id":"8e72485b-2cc6-4b9a-b5fa-6a56e2673251","resolution":{"observed_at":"2026-05-16T08:47:37.371987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-07-06T22:47:59.530407Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:e5a19ca92e18f4531f3456ecf462a84d957a24d7aa086040fd2c62131668a556","observation_id":"b65cae82-50fa-4474-8a71-11e63c0c172f","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2603.15045","last_updated":"2026-07-07T07:07:08Z","snapshot_observed_at":"2026-07-14T20:46:16.914552Z","submitted_at":"2026-03-16T09:57:06Z","title":"LLMs and Speech: Integration vs. Combination","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T10:41:22.138517Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2603.15045"},"observation_digest":"sha256:fff5e6bcaffe7e77f8faa46956a31c114cd858c5456ba3911d3a4212d3e5a21d","observation_id":"23f4929f-2385-44b7-8bab-2fc0103db38e","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-14T20:46:17.286576Z","title":"Audiopalm: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.15045","last_updated":"2026-07-07T07:07:08Z","snapshot_observed_at":"2026-07-14T20:46:16.914552Z","submitted_at":"2026-03-16T09:57:06Z","title":"LLMs and Speech: Integration vs. Combination","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T20:46:17.286576Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2603.15045"},"observation_digest":"sha256:b66e432f271ac78cd6b85da4fad6382c9d8c9524835a563e0b053c2002d7d516","observation_id":"7db8a1d4-4cd8-44ac-88a0-9bfad8030621","resolution":{"observed_at":"2026-07-14T20:46:17.286576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2604.09222","last_updated":"2026-04-10T11:27:25Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T11:27:25Z","title":"GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:40:59.993298Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2604.09222"},"observation_digest":"sha256:6b22c15c8686f14ae2a1c5abf7853c7533173ba2fab38588efdaf1f1d3bf64b8","observation_id":"4362face-5bed-465d-b259-41e07951cfe8","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2604.09332","last_updated":"2026-04-10T14:00:24Z","snapshot_observed_at":"2026-07-06T22:58:12.847181Z","submitted_at":"2026-04-10T14:00:24Z","title":"Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:33:32.012025Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2604.09332"},"observation_digest":"sha256:8454e5480ddd6250de3f27798410845641fe2fc7eea7a79b015bd241d81f11c0","observation_id":"97ec44a6-bc12-4425-babb-b6a8e751cd52","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2604.12148","last_updated":"2026-04-13T23:54:58Z","snapshot_observed_at":"2026-07-06T23:00:22.690154Z","submitted_at":"2026-04-13T23:54:58Z","title":"ViLL-E: Video LLM Embeddings for Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:00:43.573409Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2604.12148"},"observation_digest":"sha256:950a0b26c5c38a89ea842f3d1be41520406ec5c8d690f55ed0ef9ab04f000f99","observation_id":"f1fc358f-0d6b-4632-8dcb-cf87c439a3de","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2604.13715","last_updated":"2026-04-15T10:50:29Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T10:50:29Z","title":"Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T12:37:17.843365Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2604.13715"},"observation_digest":"sha256:a7ade6369a490cf4d27abb61bf4d84f872b65b62514ee746d2c97e3f08413612","observation_id":"e1475385-ea6f-4c0b-90d8-222a94cae204","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2604.16615","last_updated":"2026-04-17T18:12:33Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T18:12:33Z","title":"Beyond Feature Fusion: Contextual Bayesian PEFT for Multimodal Uncertainty Estimation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T08:40:13.279841Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2604.16615"},"observation_digest":"sha256:9c1a35e35f1886bb55f297c8922171668e7f6847927f9cc2f89e93fcd7bd105c","observation_id":"697e3bb3-066a-4ab8-86d3-3df871aa772d","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2604.20719","last_updated":"2026-04-22T16:06:48Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:06:48Z","title":"ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T23:03:01.356594Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2604.20719"},"observation_digest":"sha256:44567522082a631805f7f96a9b0aa9ed51be86a25c2fe4c652654fd3671726eb","observation_id":"20bc72ea-b452-4915-bea1-fa8d40bfdb1b","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2604.22817","last_updated":"2026-04-14T20:56:24Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-14T20:56:24Z","title":"In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T13:25:50.524448Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2604.22817"},"observation_digest":"sha256:2e535379b1db1ac41f93a2ef731984cd9cc6b4ea29f2230165540af92cb2daad","observation_id":"7086e60b-dd63-4f3e-bbd1-055b11621a4e","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2604.23295","last_updated":"2026-05-25T03:30:22Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T13:18:40Z","title":"Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T08:16:47.522489Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2604.23295"},"observation_digest":"sha256:7785d0758b13a80bf9ff187a858c10349d45f7f3e1e9957b9ab090b8facfbfe8","observation_id":"44c0cbd6-526b-415d-a0a5-de2ead981b81","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T12:25:52.847432Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:22a2da7057c931376165abcda8ea56af00ca4adbfe011fd9250afd7d326204d0","observation_id":"466c03b9-9196-45a1-b0a0-dd2b53f4ce99","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T23:14:32.494076Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:17b45106500272655822e4c54c08cffbfc51f1ee40f266290a095fc09da9c6df","observation_id":"f41b4629-0450-4767-8953-2baa927df29d","resolution":{"observed_at":"2026-06-30T23:15:07.814230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.14340","last_updated":"2026-06-25T04:41:51Z","snapshot_observed_at":"2026-07-06T23:25:49.545418Z","submitted_at":"2026-05-14T04:04:03Z","title":"Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:53.100809Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.14340"},"observation_digest":"sha256:d740f61ef2e6601a940369237da9290cfb5102755badcd5b59c7bd5d9d1a0ff2","observation_id":"aaa2c169-7f71-48d4-872e-af410ee72835","resolution":{"observed_at":"2026-05-16T07:07:57.965390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.14340","last_updated":"2026-06-25T04:41:51Z","snapshot_observed_at":"2026-07-06T23:25:49.545418Z","submitted_at":"2026-05-14T04:04:03Z","title":"Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T20:42:10.489048Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.14340"},"observation_digest":"sha256:26221f8f731efe5064edf4a7eb474ab66ca327e2eff81206d3f6873014bfc992","observation_id":"abf47f2f-ba85-43ad-9797-4b86d9ab3211","resolution":{"observed_at":"2026-06-30T20:45:03.651036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.17583","last_updated":"2026-05-14T13:31:23Z","snapshot_observed_at":"2026-07-06T23:28:36.134614Z","submitted_at":"2026-05-14T13:31:23Z","title":"AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-20T21:14:58.814362Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.17583"},"observation_digest":"sha256:e124dbad48847c7264246a971386fe3e6290af9f72197e7b58563e89a7aeb568","observation_id":"d48dc5b6-11f7-4499-896c-35402376e954","resolution":{"observed_at":"2026-05-20T21:19:03.238948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.19101","last_updated":"2026-05-18T20:41:08Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:41:08Z","title":"Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T07:13:29.041056Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.19101"},"observation_digest":"sha256:5a11ebd0691ba7df78a054c95a87fb6f6665a890d38fd4c5d1c25303b554244b","observation_id":"aa595d77-54f3-479c-9406-a96890a868ae","resolution":{"observed_at":"2026-05-20T07:18:07.286520Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:9d46bc428d1793bc4e3b0e81516499bebfcea01a9eb087c8d53112199e73051f","observation_id":"d6f59265-9359-4906-b01c-3441777c4884","resolution":{"observed_at":"2026-05-21T07:39:49.121346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.20588","last_updated":"2026-05-20T00:54:11Z","snapshot_observed_at":"2026-07-06T23:31:08.671011Z","submitted_at":"2026-05-20T00:54:11Z","title":"Direct Translation between Sign Languages","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T05:54:08.019738Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.20588"},"observation_digest":"sha256:b40566fd1a74d3de8e8655be50e6c4f9d3245aa626e32a70207b4bd58bb497ba","observation_id":"c07f6c49-bd15-4d72-82cf-5fcb0c2c5ab0","resolution":{"observed_at":"2026-05-21T05:54:40.691154Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.20946","last_updated":"2026-05-20T09:32:35Z","snapshot_observed_at":"2026-07-06T23:31:27.989406Z","submitted_at":"2026-05-20T09:32:35Z","title":"Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-21T05:53:57.830880Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.20946"},"observation_digest":"sha256:81719fc85cdffb2c2d89a32c9fefcf08625a50490aacf28788a41fc024c75693","observation_id":"a0b94de7-b2d8-424e-a57b-dac836006370","resolution":{"observed_at":"2026-05-21T05:54:40.728191Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.22170","last_updated":"2026-05-21T08:41:39Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:41:39Z","title":"Do Factual Recall Mechanisms Carry over from Text to Speech in Multimodal Language Models?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T06:26:19.580671Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.22170"},"observation_digest":"sha256:f6bcd135d6c88c3d9f7a79904db45800bcc80c5962ecea6d664c8137c667fc6f","observation_id":"6bf2e881-a9ad-4f4c-b240-68ab16f04ba1","resolution":{"observed_at":"2026-05-22T06:31:10.527590Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.23954","last_updated":"2026-05-11T06:30:25Z","snapshot_observed_at":"2026-07-06T23:34:03.934151Z","submitted_at":"2026-05-11T06:30:25Z","title":"EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T22:52:43.396119Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.23954"},"observation_digest":"sha256:d46370213a567c51f496ed28df8f0219c6493cf9a2a5f57b9436b302d4ac1997","observation_id":"26a40d52-1137-4b4b-9451-cea9a95f1966","resolution":{"observed_at":"2026-07-01T13:45:45.546883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.04474","last_updated":"2026-06-11T09:28:59Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T05:44:09Z","title":"Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T06:41:25.592270Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.04474"},"observation_digest":"sha256:2caf78fd0a341573b0f45a46e100431e6023187028a482794f9c4986df367051","observation_id":"b6454bdb-ef7b-4124-b450-3705762939a6","resolution":{"observed_at":"2026-07-02T07:46:46.220396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.06940","last_updated":"2026-06-10T06:55:49Z","snapshot_observed_at":"2026-07-06T23:46:42.693840Z","submitted_at":"2026-06-05T06:11:38Z","title":"Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:16:07.007759Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.06940"},"observation_digest":"sha256:8a17f3fe989b4e20e3e2fd5605db45efcb1b2af149468ac1c063bcda71fe84b6","observation_id":"81d14c45-8060-4dad-901d-2ada3f13f65e","resolution":{"observed_at":"2026-07-02T19:47:19.978870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-07-06T23:48:44.159537Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:4f52d37963cf72cf2bff91bb9fee0746a7fbec95c6bd9f8c8888957eb8a40d75","observation_id":"f5b65a5e-84a4-4f2a-9e20-ebb402c64e0e","resolution":{"observed_at":"2026-07-03T01:37:30.599502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.10581","last_updated":"2026-06-09T08:45:52Z","snapshot_observed_at":"2026-07-06T23:49:47.137691Z","submitted_at":"2026-06-09T08:45:52Z","title":"ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T13:23:05.518547Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.10581"},"observation_digest":"sha256:f9630fa745412785f2bdc77a9db74020d9e33502ce8956b99963a1200110e81a","observation_id":"5d036bd6-9f2a-47ad-ba37-db9e90e10ce6","resolution":{"observed_at":"2026-07-03T05:07:39.453814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":262,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:81ad4207858ec1a13fd06b106fc265515bbe7165992faa8bc83e264264d96d78","observation_id":"f81c375d-f0ab-4f3e-8be3-771619bdadab","resolution":{"observed_at":"2026-06-30T22:15:05.368589Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.12199","last_updated":"2026-06-10T15:19:15Z","snapshot_observed_at":"2026-07-06T23:51:07.629939Z","submitted_at":"2026-06-10T15:19:15Z","title":"Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T08:18:23.182355Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.12199"},"observation_digest":"sha256:094cffb1bb0c42a6c524c7b7625b80fc16ec4f207db90ba8f5251087729ed291","observation_id":"56d51efa-b234-4d4f-a7fd-1306ac4557d8","resolution":{"observed_at":"2026-07-03T13:18:12.795686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.12902","last_updated":"2026-06-11T04:59:33Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T04:59:33Z","title":"PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T06:53:13.344795Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.12902"},"observation_digest":"sha256:f60bf08ddf7360dfc9876f7dbb4a56680a2eb29fb52fd625d6e5378885d6286a","observation_id":"5d760ff3-1def-44b4-974b-aa41bc8ba86d","resolution":{"observed_at":"2026-07-03T14:48:33.550739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.12940","last_updated":"2026-06-11T06:06:02Z","snapshot_observed_at":"2026-07-06T23:51:45.306189Z","submitted_at":"2026-06-11T06:06:02Z","title":"Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T06:05:26.735340Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.12940"},"observation_digest":"sha256:5b11603afe0db538a401bf25760d3806223e41123484af5699602fd72c6a21fc","observation_id":"6861a717-7b75-4f71-b0af-b0f9deb946a7","resolution":{"observed_at":"2026-07-03T16:08:37.454479Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.13464","last_updated":"2026-06-11T15:18:32Z","snapshot_observed_at":"2026-07-06T23:52:14.348914Z","submitted_at":"2026-06-11T15:18:32Z","title":"Ontology Memory-Augmented ASR Correction for Long Text-Speech Interleaved Conversations","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T07:06:13.658919Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.13464"},"observation_digest":"sha256:5316a9b3b4a504be46af42e2b6862ac13c161a6271ec9b01b09bc84f5fbbfad8","observation_id":"f9c5f736-22d6-4750-9c1d-33408eed34dd","resolution":{"observed_at":"2026-06-27T07:10:41.482225Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:c8d70f5f53c7c8663f548039444b2d65fbf9b7e010d5e636528ac307f2351a7f","observation_id":"86901faf-a1a2-46f6-b70e-cc3fe8ad8977","resolution":{"observed_at":"2026-07-04T11:59:50.965295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.25436","last_updated":"2026-06-24T05:57:45Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T05:57:45Z","title":"Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T20:08:33.322532Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.25436"},"observation_digest":"sha256:6e4c4de36bfda113263d141081d94b56a5dd91339485a1b53e0e0e8854a81e92","observation_id":"6113f7ee-e4b1-4231-a088-fb8bf09941d7","resolution":{"observed_at":"2026-07-04T20:30:07.199395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.25444","last_updated":"2026-06-24T06:15:18Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:15:18Z","title":"Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T20:03:10.858349Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.25444"},"observation_digest":"sha256:539f202dc61555b10c80417b49fbba63eab809bb190a6514dacf6a13cf3ec0dd","observation_id":"4bc40f73-88d8-4062-9086-1ad926b14211","resolution":{"observed_at":"2026-07-04T20:30:08.194470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T09:35:03.660671Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:b4915ab5f74d268ff81f282cad39f9aa634ef3c09f17cb8a391f0a50e0e1a564","observation_id":"e0a2e54e-5510-462d-b657-e2650a622d66","resolution":{"observed_at":"2026-06-30T12:54:40.690218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-12T11:11:08.878850Z","title":"Audiopalm: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T11:11:08.878850Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:979a4377dcd5644c377b93f9161d9111717177f4ca8bbae293fc72dc4330a0ca","observation_id":"e6e48d35-7858-4ab0-a4bd-b50b870ffa7d","resolution":{"observed_at":"2026-07-12T11:11:08.878850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2606.30145","last_updated":"2026-06-29T11:22:50Z","snapshot_observed_at":"2026-07-07T00:04:00.652252Z","submitted_at":"2026-06-29T11:22:50Z","title":"FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T06:38:28.718164Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2606.30145"},"observation_digest":"sha256:55397e88397c3a451ed91250cac63a94cfbf4f6093ee75afc6c958d29b543730","observation_id":"b66131a4-129b-4253-b2d9-870cc4b0d8e3","resolution":{"observed_at":"2026-06-30T06:44:19.376639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2607.01865","last_updated":"2026-07-02T08:20:03Z","snapshot_observed_at":"2026-07-07T00:07:23.664493Z","submitted_at":"2026-07-02T08:20:03Z","title":"Neural Audio Codec with Adjustable Token Temporal Resolution Using Sampling-Frequency-Independent Convolutional Layers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T05:15:41.526048Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2607.01865"},"observation_digest":"sha256:f5e26c24d046da2df2be4bbda98da209a2d841c38495287f9ceb9aa926efd61e","observation_id":"7d620171-28d8-4eed-974b-bfb03e61101f","resolution":{"observed_at":"2026-07-03T05:17:40.016175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2607.01960","last_updated":"2026-07-02T09:52:08Z","snapshot_observed_at":"2026-07-07T00:07:28.231599Z","submitted_at":"2026-07-02T09:52:08Z","title":"NAVER LABS Europe Submission to the Instruction-following 2026 Short Track","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-03T15:04:02.640015Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2607.01960"},"observation_digest":"sha256:74d169de7f0dd48f62e1d04a67a12a7c1aecc2ccaf4e8a4fbed9700d20fbf018","observation_id":"393dd19c-04e8-4b2a-a6b2-35c522eb076d","resolution":{"observed_at":"2026-07-03T15:08:32.410238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":238,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:7e03350a5c54e616ca562f319761e02e039f89a0fbfbf78ef62b780e44da3613","observation_id":"74155a37-6d9e-4e87-904f-4ae381eba66b","resolution":{"observed_at":"2026-07-08T00:04:22.620815Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2306.12925 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":238,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:a5e2ac90ef9f8bded20fa2f3a67d2e8617cc98166a7c4ce9759f2f39fe549aa8","observation_id":"e4c9bea6-6239-4ca3-82ad-920ffef0b665","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2607.08409","last_updated":"2026-07-09T12:34:56Z","snapshot_observed_at":"2026-07-12T23:18:30.528461Z","submitted_at":"2026-07-09T12:34:56Z","title":"When Synthetic Speech Is All You Have: Better Call GRPO","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T07:53:41.580597Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2607.08409"},"observation_digest":"sha256:5273f3197fe714ff4a8042ac94b052e652c5eea0ae0151a30bf22516119cbcd1","observation_id":"f8a95b65-001a-4544-bf80-7d7c79d6f798","resolution":{"observed_at":"2026-07-10T07:56:57.817961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2306.12925/citation-record","integrity":"/paper/2306.12925/integrity","json":"/paper/2306.12925/citation-record.json","paper":"/paper/2306.12925"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":"2301.11325","doi":"10.48550/arxiv.2301.11325","metadata_source":"pith","pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-07-10T15:47:23.314497Z","title":"MusicLM: Generating Music From Text","venue":"cs.SD","work_id":"15e6566e-1c36-468f-966e-823248cbf87f","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:556e3da8806353bb648c794865965e13ccd1508830b5cdda255bd005ef3ace7f","observation_id":"f6eec113-0800-4141-84fb-7a9173153aed","resolution":{"observed_at":"2026-05-16T07:07:57.880338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2305.10403","doi":"10.48550/arxiv.2305.10403","metadata_source":"pith","pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-07-10T13:57:07.008081Z","title":"PaLM 2 Technical Report","venue":"cs.CL","work_id":"905ee9a7-ea61-4a94-bd62-2600cbe3e315","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:e69ac9d6da4199e748460bcb544b800c6cae92a0330fbf36f94d2ed5f13ff39f","observation_id":"2cc3e3ba-e23a-41a7-95ba-2a4f6cd02634","resolution":{"observed_at":"2026-05-16T07:07:57.847985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ISBN 979-10-95546-34-4","venue":null,"work_id":"21667f47-f003-4382-b396-17b57c530dd7","year":2020},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:c92b8f4b4d937de4b7f33101818f0da56b65e7cc14e6b0d227af2a0ebe4d37d0","observation_id":"3a23f3e7-60a8-4889-866f-ae7823c9377d","resolution":{"observed_at":"2026-05-16T07:07:57.951079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01374","last_updated":"2022-02-03T02:26:40Z","snapshot_observed_at":"2026-07-06T12:34:00.262764Z","submitted_at":"2022-02-03T02:26:40Z","title":"mSLAM: Massively multilingual joint pre-training for speech and text","version":1},"cited_work":{"arxiv_id":"2202.01374","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.01374","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bapna, C","venue":null,"work_id":"c143c52c-596d-4470-b0f4-abac681bd925","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2202.01374","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:e9ae1e95011d9781d27803c5fd851a069e42d8e48bb11caf7d5a75f9b7817c47","observation_id":"46595cb1-d75f-46f7-8141-624fc939a5c5","resolution":{"observed_at":"2026-05-16T07:07:57.851683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Barrault, O","venue":null,"work_id":"0c91c9d2-37ba-46d7-b2b3-d74c9b276fd3","year":2019},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:4abd3bc423be2f671581f847baeba4491ca2da656edc4c8b503b28442a7b3ac4","observation_id":"a0d0240c-b785-4828-89a6-b9447878a1c0","resolution":{"observed_at":"2026-05-16T07:07:57.959789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cd75e60b-1e3d-4564-aad3-973ef1ae1be6","year":2020},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:86cbf78cda06db1437ed03dafbe27835d032f999614d82c63debf89b1b36cc1e","observation_id":"8fe03784-b822-4e43-aacf-6408d5176461","resolution":{"observed_at":"2026-05-16T07:07:57.962450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"org/2020.wmt-1.1","venue":null,"work_id":"47583556-b1b3-4881-b1f0-e6cf7a7978d8","year":2020},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:6c383c0ca74ad9fa8aaadf5b3a0151e03828bc3da3c0d0439654e2a81f863b7e","observation_id":"7561c7d2-fd9b-4451-92c2-c521f32e5a6e","resolution":{"observed_at":"2026-05-16T07:07:57.957668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"12767fc6-2371-4cee-beee-9801d767b847","year":2015},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:fc4187080982cfb74a13b139390ef1b4538de8a89b8f284a4e1cb9d21719799c","observation_id":"7bf0ae9d-5eb7-4b4a-a19d-c0a7b8943226","resolution":{"observed_at":"2026-05-16T07:07:57.946530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"68197cf0-6fdb-434f-b700-b64c9eceee38","year":2017},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:3d1e9c43f126b9d134da2384db0ffc047dd683cd965dfcdcd0d84d33b01e7aa9","observation_id":"6ddc9af9-8a1a-45c5-98ae-ab1b778e9d37","resolution":{"observed_at":"2026-05-16T07:07:57.934046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"635bc3bc-a9df-4bd9-b27e-d377c14977f4","year":2018},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:12ddda77aa5a1cd7fff6ffdb16a6a7be4668ea27ed96947b18899c5a0edb9650","observation_id":"eee3fbf9-fade-4b92-bf9b-2d71fda20473","resolution":{"observed_at":"2026-05-16T07:07:57.936518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-07-06T13:49:44.678985Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.03143","doi":"10.48550/arxiv.2209.03143","metadata_source":"arxiv_reference","pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":"3a2aea1c-8117-4436-9100-0536aea3cf47","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:a5f780e08bfeb5708c2aaae75ed0303b364c1be10e4c56067db780b75e4ad587","observation_id":"3803036b-ccec-42d2-b2ea-823ae98ff3a1","resolution":{"observed_at":"2026-05-16T07:07:57.914573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-07-06T15:28:16.998343Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":"2305.09636","doi":"10.48550/arxiv.2305.09636","metadata_source":"pith","pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AudioLM: A language modeling approach to audio generation.IEEE/ACM Trans","venue":"cs.SD","work_id":"c68926d8-7cb2-4b44-9b10-396551c6bb67","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:7d4c8d7cc0c3c3b3cb6b321ca6458ee7346e30129e98de1ccaf161b94775679b","observation_id":"42dd9788-f40a-4fc5-ab55-c6d196393a9b","resolution":{"observed_at":"2026-05-16T07:07:57.919203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a47f30da-533f-483f-9934-684bc552f60d","year":2020},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:955a0fe6b463f79fe009a5350ceef403c40603e03e32c074a7032e4aebe66eb5","observation_id":"81cb6522-d1b6-4dad-bc16-86fd86254f03","resolution":{"observed_at":"2026-05-16T07:07:57.944293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.318811","doi":"10.1109/jstsp.2022.3188113","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html","venue":null,"work_id":"7d155bea-12ee-4311-9cc9-09e1315de397","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:f12d59bf39fbf2f491e735c9c81472254cd89257224502db6275285688ec8c92","observation_id":"4db85b1f-9af3-47c2-8dc6-eb18a317ecb4","resolution":{"observed_at":"2026-05-16T07:07:57.833344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:49:45.636217+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:49:45.636217+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03409","last_updated":"2022-07-01T19:53:30Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T12:48:16Z","title":"MAESTRO: Matched Speech Text Representations through Modality Matching","version":2},"cited_work":{"arxiv_id":"2204.03409","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.03409","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"16552017-e420-4eee-bbf8-6125f8dddeae","year":null},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2204.03409","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:b6ef16da8d3e0d799f2e23031aeb21ad4d595e9eac958227d52d1722b1198420","observation_id":"23b77fbb-f4af-495a-adc8-a8f96f9b7c33","resolution":{"observed_at":"2026-05-16T07:07:57.923505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-07-10T12:07:03.432645Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:4d968c8d557b508ba3bac8afc5b3bf660994f11540ccf11084168caedccdd340","observation_id":"dc54923b-933c-406d-87c1-c16c58f5a204","resolution":{"observed_at":"2026-05-16T07:07:57.927728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conneau, M","venue":null,"work_id":"8c702050-8b6a-4f79-ad24-76ebe0547501","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:f39879b349cb07a35efafd13c32cdb1d855e347a3e9f0caae8c68f12f236faa9","observation_id":"5c1e4ed4-24f7-4478-bd5a-efb10731b9e1","resolution":{"observed_at":"2026-05-16T07:07:57.953278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-07-06T14:09:44.949023Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:2b5f2650a9698ab344ab9b2f166d43f0a843c0d4bfffabe9198caf250f76bf67","observation_id":"461a446a-d472-4a72-9ff7-6c52f7f8362b","resolution":{"observed_at":"2026-05-16T07:07:57.931493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-07-06T14:09:44.949023Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:df16188858147819dc90fb11a45c3e092d537556d4ab00b62c25d1acf6ab69c1","observation_id":"005414fe-954b-43e6-9562-48fbc81b2a72","resolution":{"observed_at":"2026-05-16T07:07:57.829506Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12662","last_updated":"2023-01-30T04:53:23Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T04:53:23Z","title":"SingSong: Generating musical accompaniments from singing","version":1},"cited_work":{"arxiv_id":"2301.12662","doi":"10.48550/arxiv.2301.12662","metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12662","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Donahue, A","venue":null,"work_id":"e61a35d5-66c7-47cf-8fab-6a224d21a3e3","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2301.12662","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:268f251d8de08e4d86c92e0b8d31330ca92a758ce60eca4412238dcc31700c70","observation_id":"b1679d38-3718-44eb-abc5-c42791bf174d","resolution":{"observed_at":"2026-05-16T07:07:57.854947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12662","last_updated":"2023-01-30T04:53:23Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T04:53:23Z","title":"SingSong: Generating musical accompaniments from singing","version":1},"cited_work":{"arxiv_id":"2301.12662","doi":"10.48550/arxiv.2301.12662","metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12662","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Donahue, A","venue":null,"work_id":"e61a35d5-66c7-47cf-8fab-6a224d21a3e3","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2301.12662","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:0649824cdfaddc906d243ae18eeca7da71fc9ffe993f8a814fa7555606df9c9b","observation_id":"9afb53b4-24ef-4935-8638-e76401a69ac4","resolution":{"observed_at":"2026-05-16T07:07:57.825739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6558d992-7d37-4ef8-94a1-2868fd30380b","year":2017},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:3d9cc1533661a9da480f8171464f6702e880248b525286e1814c5420271f282b","observation_id":"5a7b3691-3bf3-419e-9e4f-249fe9612f82","resolution":{"observed_at":"2026-05-16T07:07:57.964582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13009","last_updated":"2024-01-30T11:52:51Z","snapshot_observed_at":"2026-07-06T15:30:37.936757Z","submitted_at":"2023-05-22T13:12:16Z","title":"Textually Pretrained Speech Language Models","version":3},"cited_work":{"arxiv_id":"2305.13009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13009","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hassid, T","venue":null,"work_id":"638062a9-91cc-49ba-83f6-a4fbecd6f879","year":2024},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2305.13009","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:8f36744f45a585de14c468c09af3d62519133d9c842336730858572a9ae002c5","observation_id":"d1c8f20b-cb0a-4f0a-b03c-fd8f2e450c29","resolution":{"observed_at":"2026-05-16T07:07:57.858878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"423800a0-1a73-4c09-bfe0-259b2357b466","year":2021},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:729454daa6450fcc65e7094d4b9ae232017187597a7c1dd0ea1abf5f313fac65","observation_id":"1081a94c-384d-41f8-b430-fb48a3de3db6","resolution":{"observed_at":"2026-05-16T07:07:57.941824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13339","last_updated":"2022-06-27T18:11:56Z","snapshot_observed_at":"2026-07-06T12:52:09.145702Z","submitted_at":"2022-03-24T21:06:15Z","title":"Leveraging unsupervised and weakly-supervised data to improve direct speech-to-speech translation","version":2},"cited_work":{"arxiv_id":"2203.13339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.13339","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0a799906-2d49-42db-88d9-bf635f24ba11","year":null},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2203.13339","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:af9a86889e85d939d823cff7c370f6de89f4ed9c1bd3caa3cd20a27d9a53b414","observation_id":"9536e6d7-2c9a-4829-bffd-cf841a63969b","resolution":{"observed_at":"2026-05-16T07:07:57.862117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03540","last_updated":"2023-02-07T15:48:31Z","snapshot_observed_at":"2026-07-06T14:49:19.585577Z","submitted_at":"2023-02-07T15:48:31Z","title":"Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision","version":1},"cited_work":{"arxiv_id":"2302.03540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.03540","snapshot_observed_at":"2026-07-04T01:29:22.090341Z","title":"Kharitonov, D","venue":null,"work_id":"9e48bb54-29e4-4b9a-9444-397dff3045b2","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2302.03540","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:973c94d72ffa3e88247d80d6a12bda89ef90038382548509799bebfc1993538d","observation_id":"18efb642-dc83-4d3b-b56f-8a5f624116de","resolution":{"observed_at":"2026-05-16T07:07:57.865670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-07-06T13:58:10.903203Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:4160c58e48953258a8a05b106ceefb9683bd34705f991939a88d26282b5f4785","observation_id":"ead98b7d-9584-4ad0-a34c-abdfe64ff9ed","resolution":{"observed_at":"2026-05-16T07:07:57.868936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-07-06T13:58:10.903203Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:7f24eeddd58eb350a75672071c7f19b02383ec9db050dff955faf3923d0f76ca","observation_id":"9a1c68fa-3bca-4550-bce5-b4e39b77681c","resolution":{"observed_at":"2026-05-16T07:07:57.841399Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08352","last_updated":"2022-05-04T18:16:38Z","snapshot_observed_at":"2026-07-06T12:19:11.280873Z","submitted_at":"2021-12-15T18:56:35Z","title":"Textless Speech-to-Speech Translation on Real Data","version":2},"cited_work":{"arxiv_id":"2112.08352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.08352","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textless speech-to-speech translation on real data","venue":null,"work_id":"7f57d74d-c933-483f-9604-0b163301d10d","year":2021},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2112.08352","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:a73aaff5b46a568f21c3078b6649b0bb3df9c66590a4f832aae060fe5f8bf0bd","observation_id":"bb76f95e-ce07-4342-bcc8-7cc4274a8ae2","resolution":{"observed_at":"2026-05-16T07:07:57.872950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08250","last_updated":"2022-01-12T22:30:25Z","snapshot_observed_at":"2026-07-06T11:58:24.426799Z","submitted_at":"2021-10-15T17:59:15Z","title":"Direct Simultaneous Speech-to-Speech Translation with Variational Monotonic Multihead Attention","version":2},"cited_work":{"arxiv_id":"2110.08250","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.08250","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2439396b-debf-48e4-9cc6-f85f5353d2a2","year":null},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2110.08250","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:66296d82b1fc45ccead9bccfd786217ecfb61ffdffe0c048f9236252cb7492b4","observation_id":"4b0fa63a-8a40-4832-8522-6c9979623af7","resolution":{"observed_at":"2026-05-16T07:07:57.876855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:d5cd4b0bcee737d54b6bf016ac5607482ae016f987e0f474fc2199c11f0e41bd","observation_id":"f828482a-e636-4e2c-8a23-f613b6e71548","resolution":{"observed_at":"2026-05-16T07:07:57.844864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":"2012.03411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-07-10T20:37:34.434656Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","venue":"eess.AS","work_id":"8d788441-917e-4c1a-a15c-24d0fc471364","year":2020},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:c44d1d5e33f374f8f3d41a1c5312a6b50278d4f7412edfba2c9678557d44aa23","observation_id":"fd363f26-c4b4-412d-af61-829595318744","resolution":{"observed_at":"2026-05-18T14:55:30.523308Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"caf8da1d-8d0c-48c6-9d67-1ecbc8bb115c","year":2018},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:ba525ece6b2ca9332129677e410fd4e646c00f83f38202f1539eb3e471352284","observation_id":"469aeb7a-379b-40b0-aad3-4a1b44334166","resolution":{"observed_at":"2026-05-16T07:07:57.939537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a4876721-b1c0-48d8-a107-fde45659d24b","year":2084},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:2d7ae959cd6edeecb0ee3f8c614185b41c6da44264880b254a52abe24dd588f2","observation_id":"9f8e0cfe-3407-4564-86fa-c8007dc34f89","resolution":{"observed_at":"2026-05-16T07:07:57.948852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-07-10T12:57:07.586760Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:ca2913b4c6fadbd092feb42daaeebc6017f0b7275a86dfe8bdb3a88622dc2ae9","observation_id":"9c409c77-d2f6-46a8-bb54-13ea20ac87b2","resolution":{"observed_at":"2026-05-16T07:07:57.890817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:52.113971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:52.113971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:714b3d7315714e5ebe770ef00835a93b84c83863a418616f200c37b97dcb004a","observation_id":"dbf0ed76-bf9a-4c19-9fc2-6df06ffb022e","resolution":{"observed_at":"2026-05-16T07:07:57.895770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-07-06T09:40:19.270377Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":"2007.10310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-07-04T20:30:07.211214Z","title":"Covost 2 and massively multilingual speech-to-text translation","venue":null,"work_id":"6c9bffaf-0bd1-4fa9-ac70-56e01e042f08","year":2007},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:c21565f61cf4b2a123284e215adf396c23575c159642275b637ac724a567a84e","observation_id":"0be3195c-1df0-4d4d-af57-6e9552c6d881","resolution":{"observed_at":"2026-05-16T07:07:57.900167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-07-06T14:37:43.837878Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:caf0148b7d00c02966ba1d7d3b001f1bff70cad65b83545d20e3b7b71fad9466","observation_id":"40f490d2-0806-4da5-bdb6-2be2199dab83","resolution":{"observed_at":"2026-05-16T07:07:57.904544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-07-10T21:57:37.821767Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:b209d679de4b33c672060a0045152505a4eb203d50c2a51a904af7f05975a250","observation_id":"15ec8616-8e22-470c-97aa-bef1f122e1ac","resolution":{"observed_at":"2026-05-16T07:07:57.837411Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.391775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.391775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-07-06T14:57:43.345085Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":"2303.01037","doi":"10.48550/arxiv.2303.01037","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":null,"work_id":"83cf7cd1-c22e-4664-b983-8e943ea096fb","year":2023},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:d1d4eff00a89238c3be620655e04179e86f9ac7165ee84b257fde8c887505439","observation_id":"6ac8d2d5-b915-4ac9-bc4a-e8f79f515d34","resolution":{"observed_at":"2026-05-16T07:07:57.909447Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b616acf7-1d76-4c1a-9245-c77b836b053a","year":2077},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:31cb605bfa6075d230e330d3dc8d86368b10875b4a09a495c6e3a802f4446379","observation_id":"5d1ca95b-e901-43c1-ba66-8378f6cc8a70","resolution":{"observed_at":"2026-05-16T07:07:57.955271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T15:45:32.070369Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":2,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":21,"verified_fuzzy":14},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"thesis":"As of 24 July 2026, this Paper Citation Record lists 41 of 41 outbound references and 58 inbound Pith citation observations for arXiv:2306.12925."}