Pith. sign in

Paper Citation Record · LEDGER

AudioPaLM: A Large Language Model That Can Speak and Listen

As of 23 July 2026, this Paper Citation Record lists 41 of 41 outbound references and 58 inbound Pith citation observations for arXiv:2306.12925.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2306.12925 v1

Coverage vector

measured 41 of 41 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-16T07:07:57.800866Z

measured 99 of 99 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-07-23T06:31:01.910684+00:00

measured 58 of 58 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-14T20:46:17.286576Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-10T07:56:57.816571Z

Reference resolution

41 of 41 outbound references displayed

  • verified exact21
  • verified fuzzy14
  • unresolved0
  • parse uncertain0
  • malformed identifier2
  • metadata mismatch4

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f6eec113-0800-4141-84fb-7a9173153aed · outbound

This paper cites MusicLM: Generating Music From Text.

AudioPaLM: A Large Language Model That Can Speak and Listen MusicLM: Generating Music From Text

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-16T07:07:57.880338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:67193a08051042acfffa8edff1b80943405fe9f52c4242a242006951d009fdbd

Observation 2cc3e3ba-e23a-41a7-95ba-2a4f6cd02634 · outbound

This paper cites PaLM 2 Technical Report.

AudioPaLM: A Large Language Model That Can Speak and Listen PaLM 2 Technical Report

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-05-16T07:07:57.847985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:7b890b8ea8156d28177793dad1fc60557d5527955f5123469310525a530a3019

Observation 3a23f3e7-60a8-4889-866f-ae7823c9377d · outbound

This paper cites ISBN 979-10-95546-34-4.

AudioPaLM: A Large Language Model That Can Speak and Listen ISBN 979-10-95546-34-4

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.951079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:5cbe034704affeb17c762b473c2000a3b4c050b03036e8def4021cac5659969b

Observation 46595cb1-d75f-46f7-8141-624fc939a5c5 · outbound

This paper cites mSLAM: Massively multilingual joint pre-training for speech and text.

AudioPaLM: A Large Language Model That Can Speak and Listen mSLAM: Massively multilingual joint pre-training for speech and text

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.851683Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:1f0f55d54dfb2c38aa84ac1acd95e9fc118358c423b6c97ebf532c59c6e5ffa8

Observation a0d0240c-b785-4828-89a6-b9447878a1c0 · outbound

This paper cites Barrault, O.

AudioPaLM: A Large Language Model That Can Speak and Listen Barrault, O

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.959789Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:717c04a55d9099138063c217e54b56b56e214fa2a099868cd8ea113613975b1b

Observation 8fe03784-b822-4e43-aacf-6408d5176461 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.962450Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:e9e51a62205f89620fbc64215b73f05e6fb9ebfd98ef39a21f04eef1ea78bd0c

Observation 7561c7d2-fd9b-4451-92c2-c521f32e5a6e · outbound

This paper cites org/2020.wmt-1.1.

AudioPaLM: A Large Language Model That Can Speak and Listen org/2020.wmt-1.1

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.957668Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:0178a50ca04afccf176ae23e3dc17278ad0fd03778387e9ce56141f907940810

Observation 7bf0ae9d-5eb7-4b4a-a19d-c0a7b8943226 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.946530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:c4386a5ee5705475c53c8b51883d1d00eb56c3a92268205132c5bc8018b5589a

Observation 6ddc9af9-8a1a-45c5-98ae-ab1b778e9d37 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.934046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:40437f52e8b36afc48f551698eaf5a886d0d1f125f4dd3ca533c1e4d120be8b4

Observation eee3fbf9-fade-4b92-bf9b-2d71fda20473 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.936518Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:4894e0dec842fdd583684b31bd2ec5563bef2b0c94314fdb8460af7d292b01f1

Observation 3803036b-ccec-42d2-b2ea-823ae98ff3a1 · outbound

This paper cites AudioLM: a Language Modeling Approach to Audio Generation.

AudioPaLM: A Large Language Model That Can Speak and Listen AudioLM: a Language Modeling Approach to Audio Generation

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.914573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:8d6e041a10542156527580becf9e9d90c7ffc4bb2fbde98a070c82945e948fe5

Observation 42dd9788-f40a-4fc5-ab55-c6d196393a9b · outbound

This paper cites SoundStorm: Efficient Parallel Audio Generation.

AudioPaLM: A Large Language Model That Can Speak and Listen SoundStorm: Efficient Parallel Audio Generation

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.919203Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:237038fdefaeb2435aea0ba1755cc3cead55e6fe47dcf249d6230f714a85afae

Observation 81cb6522-d1b6-4dad-bc16-86fd86254f03 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.944293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:e12fc7bcc0cf4ee0f275ec7001263853d9eda5e146850f631cee1568c2f99a4a

Observation 4db85b1f-9af3-47c2-8dc6-eb18a317ecb4 · outbound

This paper cites neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html.

AudioPaLM: A Large Language Model That Can Speak and Listen neurips.cc/paper/2020/hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.833344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:73b724454a402cc87e6bf4a9f16b3af210cf5365b7d1f4aefa3ac1031a0f899e

Observation 23b77fbb-f4af-495a-adc8-a8f96f9b7c33 · outbound

This paper cites MAESTRO: Matched Speech Text Representations through Modality Matching.

AudioPaLM: A Large Language Model That Can Speak and Listen MAESTRO: Matched Speech Text Representations through Modality Matching

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.923505Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:49d16a39b5cdb63b484deffabcaeb53d46b0e2f6d0046a178b71bb0c937c12ea

Observation dc54923b-933c-406d-87c1-c16c58f5a204 · outbound

This paper cites PaLM: Scaling Language Modeling with Pathways.

AudioPaLM: A Large Language Model That Can Speak and Listen PaLM: Scaling Language Modeling with Pathways

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-05-16T07:07:57.927728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:0ce81fbf68a8e53341f75f5848bb0711dc2a12ea37019def1532721e74f71c53

Observation 5c1e4ed4-24f7-4478-bd5a-efb10731b9e1 · outbound

This paper cites Conneau, M.

AudioPaLM: A Large Language Model That Can Speak and Listen Conneau, M

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.953278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:a566865f32b9241956092d5200697e6aa063ab91335d62dc4207ca4b36033a58

Observation 461a446a-d472-4a72-9ff7-6c52f7f8362b · outbound

This paper cites High Fidelity Neural Audio Compression.

AudioPaLM: A Large Language Model That Can Speak and Listen High Fidelity Neural Audio Compression

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-05-16T07:07:57.931493Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:8576e6ef5dcfd7f3e20393f3635fd5d89e4c16a214b8b4f7aa0f6bf80966f8eb

Observation 005414fe-954b-43e6-9562-48fbc81b2a72 · outbound

This paper cites High Fidelity Neural Audio Compression.

AudioPaLM: A Large Language Model That Can Speak and Listen High Fidelity Neural Audio Compression

Reference 19

Resolution
metadata mismatch
local_arxiv, observed 2026-05-16T07:07:57.829506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:5c61d1ab46ff4581fc245e4bf44f32135d806433c8429faa8b421a3d8ec07730

Observation b1679d38-3718-44eb-abc5-c42791bf174d · outbound

This paper cites SingSong: Generating musical accompaniments from singing.

AudioPaLM: A Large Language Model That Can Speak and Listen SingSong: Generating musical accompaniments from singing

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.854947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:08e0f66693f38012d9df5b3fce7796a190d2cfddb47f267b73e71e98253fd758

Observation 9afb53b4-24ef-4935-8638-e76401a69ac4 · outbound

This paper cites SingSong: Generating musical accompaniments from singing.

AudioPaLM: A Large Language Model That Can Speak and Listen SingSong: Generating musical accompaniments from singing

Reference 21

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T07:07:57.825739Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:58544728aee42c81637bcb4790896310caebdada2c4344356c7e9e2ebf3e03fb

Observation 5a7b3691-3bf3-419e-9e4f-249fe9612f82 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.964582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:b8420313528a3989550eadfc297634cecf09e980ed14090fe6e26ff5e2f2c84c

Observation d1c8f20b-cb0a-4f0a-b03c-fd8f2e450c29 · outbound

This paper cites Textually Pretrained Speech Language Models.

AudioPaLM: A Large Language Model That Can Speak and Listen Textually Pretrained Speech Language Models

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.858878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:c16bcd9368f97a44afe950e0488d1400e346c224052340446efeb37584853d05

Observation 1081a94c-384d-41f8-b430-fb48a3de3db6 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.941824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:e8003384327527ec68213607c68810b7f13ff5684242c512de9d809106108111

Observation 9536e6d7-2c9a-4829-bffd-cf841a63969b · outbound

This paper cites Leveraging unsupervised and weakly-supervised data to improve direct speech-to-speech translation.

AudioPaLM: A Large Language Model That Can Speak and Listen Leveraging unsupervised and weakly-supervised data to improve direct speech-to-speech translation

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.862117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:32901789f833dfdc04a6278f99eac701ced0b4ee14f7160b8eeb30235978756c

Observation 18efb642-dc83-4d3b-b56f-8a5f624116de · outbound

This paper cites Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision.

AudioPaLM: A Large Language Model That Can Speak and Listen Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.865670Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:36a8d8e923e469f5e268f70a03ead98bd58de10444608491b586d800bc6f8f66

Observation ead98b7d-9584-4ad0-a34c-abdfe64ff9ed · outbound

This paper cites AudioGen: Textually Guided Audio Generation.

AudioPaLM: A Large Language Model That Can Speak and Listen AudioGen: Textually Guided Audio Generation

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.868936Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:14d50ca527b9ddf00cd3ecb76cc57fee7cb93d33a9a4b27057ba7c5c76e4441b

Observation 9a1c68fa-3bca-4550-bce5-b4e39b77681c · outbound

This paper cites AudioGen: Textually Guided Audio Generation.

AudioPaLM: A Large Language Model That Can Speak and Listen AudioGen: Textually Guided Audio Generation

Reference 28

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T07:07:57.841399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:0c86b898c9dd6e7afedb7e448a89769103cffe6b2778030e1d4e2199f7016958

Observation bb76f95e-ce07-4342-bcc8-7cc4274a8ae2 · outbound

This paper cites Textless Speech-to-Speech Translation on Real Data.

AudioPaLM: A Large Language Model That Can Speak and Listen Textless Speech-to-Speech Translation on Real Data

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.872950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:ec0b0eb0a3d75f6eccbbbac9f69fafc929c33bbad5db5eb201af3cecb674299d

Observation 4b0fa63a-8a40-4832-8522-6c9979623af7 · outbound

This paper cites Direct Simultaneous Speech-to-Speech Translation with Variational Monotonic Multihead Attention.

AudioPaLM: A Large Language Model That Can Speak and Listen Direct Simultaneous Speech-to-Speech Translation with Variational Monotonic Multihead Attention

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.876855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:baa85e05e43b3bf52eb9047d116d6514907a6ac27b702e202b01db0ddf751f1a

Observation f828482a-e636-4e2c-8a23-f613b6e71548 · outbound

This paper cites Representation Learning with Contrastive Predictive Coding.

AudioPaLM: A Large Language Model That Can Speak and Listen Representation Learning with Contrastive Predictive Coding

Reference 31

Resolution
verified exact
local_arxiv, observed 2026-05-16T07:07:57.844864Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:f3e579dcf8826f74bad7d42f3de0847b77b125e82e8ac9e675a33844406f4f6a

Observation fd363f26-c4b4-412d-af61-829595318744 · outbound

This paper cites MLS: A Large-Scale Multilingual Dataset for Speech Research.

AudioPaLM: A Large Language Model That Can Speak and Listen MLS: A Large-Scale Multilingual Dataset for Speech Research

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T14:55:30.523308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:876ef7639a1294a85430baeb9624ac2c68be0ff3f9ebb29d7795d8c412c86568

Observation 469aeb7a-379b-40b0-aad3-4a1b44334166 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.939537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:e638c25571975656e9acbe9f96cee2bcd6bd8b64cf05603bab38de8be1193b74

Observation 9f8e0cfe-3407-4564-86fa-c8007dc34f89 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.948852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:b1c54cb4d94848b71fbb449d1939b91babe269f9c3ec9dec074fa1097e057adf

Observation 9c409c77-d2f6-46a8-bb54-13ea20ac87b2 · outbound

This paper cites Robust Speech Recognition via Large-Scale Weak Supervision.

AudioPaLM: A Large Language Model That Can Speak and Listen Robust Speech Recognition via Large-Scale Weak Supervision

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-05-16T07:07:57.890817Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:09715345ee979260a974958c56b884b3b2333079dca0b42c389a995101359570

Observation dbf0ed76-bf9a-4c19-9fc2-6df06ffb022e · outbound

This paper cites Scaling Language Models: Methods, Analysis & Insights from Training Gopher.

AudioPaLM: A Large Language Model That Can Speak and Listen Scaling Language Models: Methods, Analysis & Insights from Training Gopher

Reference 37

Resolution
verified exact
local_arxiv, observed 2026-05-16T07:07:57.895770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:a1b6d50fe8a86398bdf7dfc951fe5cfb852f0403acb467d0b31df52b781d068b

Observation 0be3195c-1df0-4d4d-af57-6e9552c6d881 · outbound

This paper cites CoVoST 2 and Massively Multilingual Speech-to-Text Translation.

AudioPaLM: A Large Language Model That Can Speak and Listen CoVoST 2 and Massively Multilingual Speech-to-Text Translation

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.900167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:7e3d349569e08bd44c5be9718d0957be595e54c622b92d1c4c731d7d6b4370a8

Observation 40f490d2-0806-4da5-bdb6-2be2199dab83 · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

AudioPaLM: A Large Language Model That Can Speak and Listen Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-05-16T07:07:57.904544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:71f3d537a634e2845bd606aaee989bb650bbf130e91307f8957c2255e2d6efd4

Observation 15ec8616-8e22-470c-97aa-bef1f122e1ac · outbound

This paper cites Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

AudioPaLM: A Large Language Model That Can Speak and Listen Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Reference 41

Resolution
malformed identifier
local_arxiv, observed 2026-05-16T07:07:57.837411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:7c39cf76f7f25d06df1120ebe6704b5da3fb5a30ca1bcdb80d9c33717bd13d8e

Observation 6ac8d2d5-b915-4ac9-bc4a-e8f79f515d34 · outbound

This paper cites Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages.

AudioPaLM: A Large Language Model That Can Speak and Listen Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages

Reference 42

Resolution
malformed identifier
arxiv_id, observed 2026-05-16T07:07:57.909447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:c35a626731a8a91377a020305d26548914a3c9978522e6e9af2f23240b102841

Observation 5d1ca95b-e901-43c1-ba66-8378f6cc8a70 · outbound

This paper cites an unresolved cited work.

AudioPaLM: A Large Language Model That Can Speak and Listen Unresolved cited work

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-16T07:07:57.955271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T07:07:57.800866Z digest=sha256:161961f015362729c7ff70accdb793248bb245eac8a94e2d5b0c8dc9908700a1

Pith citing papers

Observation 6d5d19a8-ec8e-4dcf-aaa0-1e930b71436d · inbound

A Survey on Multimodal Large Language Models cites this paper.

A Survey on Multimodal Large Language Models AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 152

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T02:56:41.658658Z digest=sha256:c28c9c2bd38a14e402a39a5d8f38609c92f66ec4e074e9b65aa5464ecec70a93

Observation 9b502f34-cb70-408c-bd87-4055a2a6e8ac · inbound

Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation cites this paper.

Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 216

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-13T20:06:44.480769Z digest=sha256:072ea4e42a48d36d57cda6a040a8f2bb6b4ee43d1c3140c7d6a7daf434973f9f

Observation c4bb07a3-e80a-4bcb-b492-d8e23daf3585 · inbound

SALMONN: Towards Generic Hearing Abilities for Large Language Models cites this paper.

SALMONN: Towards Generic Hearing Abilities for Large Language Models AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 106

Resolution
metadata mismatch
local_arxiv, observed 2026-05-18T02:29:46.331117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-18T02:29:46.242983Z digest=sha256:a9209137fb09feb1feb0c16a84e3b00c6cdcfe11583989c61c07f6e223ee6d74

Observation 9bae3512-608d-42df-8cee-aca6de0ea124 · inbound

VideoPoet: A Large Language Model for Zero-Shot Video Generation cites this paper.

VideoPoet: A Large Language Model for Zero-Shot Video Generation AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 30

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-15T17:51:05.465548Z digest=sha256:43e1d0aed4facdaadcdfddff43fbb88e5bd12131f00a1e5135051d128c4a64eb

Observation d49019ca-98ee-4907-bd2b-a437cbe31600 · inbound

DASB - Discrete Audio and Speech Benchmark cites this paper.

DASB - Discrete Audio and Speech Benchmark AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-05-24T00:28:39.570123Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-24T00:26:57.419537Z digest=sha256:960959937b0a044f292db6b7b05ff8542f62073b7ede92bf22cedc6720f1546d

Observation 845d86b3-8597-459f-b362-021156237d04 · inbound

Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS cites this paper.

Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-05-23T20:33:25.633096Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-23T20:31:24.494060Z digest=sha256:05f21303d97d011a19e54300d4bbe14edf193f753ab12367d7deb40dc34dbdb7

Observation f452b515-2a6f-42d0-8791-4a26ba2947de · inbound

Moshi: a speech-text foundation model for real-time dialogue cites this paper.

Moshi: a speech-text foundation model for real-time dialogue AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 79

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-12T08:13:21.962488Z digest=sha256:58c78280d9cff1be219a98187c7b32d8eb0a48b5fb7fdf6fa36ca1a7e245ec1b

Observation 320f1ed4-37b4-4164-b853-dc288ec0e6fa · inbound

Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey cites this paper.

Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 207

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-15T17:18:52.996467Z digest=sha256:0c9a0c5fd9625c7cad3a1a797879051eda9c4ee7f83294dcb7a409f0465e5f99

Observation e14ce1df-f34b-45f9-8f90-b6a18f7055aa · inbound

Step-Audio 2 Technical Report cites this paper.

Step-Audio 2 Technical Report AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 57

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T05:59:50.900436Z digest=sha256:c92f928239161d30398d4ee1ddf95a651b27c58509cf0ef14a4a0e4b383c8cc7

Observation 56de3074-c47f-4837-8891-9d7bbdc6be87 · inbound

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks cites this paper.

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 51

Resolution
metadata mismatch
local_arxiv, observed 2026-05-19T02:41:59.639782Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-19T02:41:52.996457Z digest=sha256:c1afcfe82ccfdaf688761616af0c710a90c71e9b58943250cd1067c90be4e9f5

Observation 3401f375-34b5-430d-99ab-5a502de98a97 · inbound

Enhancing Speech Large Language Models through Reinforced Behavior Alignment cites this paper.

Enhancing Speech Large Language Models through Reinforced Behavior Alignment AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 43

Resolution
metadata mismatch
local_arxiv, observed 2026-05-21T22:24:23.486396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-21T22:23:52.392075Z digest=sha256:ce1cec05318322a33916bccc6ee227fefcbb719dc3dba49bbb48a4c69e79f90e

Observation 49e37056-2567-47ce-9538-73a740eb7c55 · inbound

Revisiting Direct Speech-to-Text Translation with Speech LLMs: Better Scaling than CoT Prompting? cites this paper.

Revisiting Direct Speech-to-Text Translation with Speech LLMs: Better Scaling than CoT Prompting? AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-05-18T10:31:14.897207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-18T10:28:16.040337Z digest=sha256:cbf43b44a8c2579205ca411c0a49f96bf7344c3d16fd22ef777576e29d093d9a

Observation 10c8f76f-1eec-47fe-822c-b669a9b6b5a4 · inbound

Voice, Bias, and Coreference: An Interpretability Study of Gender in Speech Translation cites this paper.

Voice, Bias, and Coreference: An Interpretability Study of Gender in Speech Translation AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 17

Resolution
metadata mismatch
local_arxiv, observed 2026-05-17T04:51:31.855446Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-17T04:50:37.457932Z digest=sha256:1c5461e9e2a5ec6efd319ef6f3c58ad437e4f9d1a3a0ebe30aa6d8f471460a21

Observation d27a1e66-cd50-43c1-99b8-4b0e0fda3db7 · inbound

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs cites this paper.

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 15

Resolution
metadata mismatch
local_arxiv, observed 2026-05-16T22:58:38.426506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-07-11T11:50:26.030339Z digest=sha256:27956196e11c35746c8eea9f672ba94e7dda19fe6a5384780b2a26bf9d086815

Observation 1c982429-0c85-4830-9ecd-da24a5a83063 · inbound

Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs cites this paper.

Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-05-16T21:51:17.782063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-16T21:49:21.785096Z digest=sha256:80329c1d0ec16ea24422fb35b18cbabfaa07235bd609e5382120655184a03945

Observation 8e72485b-2cc6-4b9a-b5fa-6a56e2673251 · inbound

Generative AI in Signal Processing Education: An Audio Foundation Model Based Approach cites this paper.

Generative AI in Signal Processing Education: An Audio Foundation Model Based Approach AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-05-16T08:47:37.371987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-16T08:44:02.494895Z digest=sha256:ec68aa26b1fc77a2b9466398681b4091806db994bf00effc906c252a25e2c237

Observation b65cae82-50fa-4474-8a71-11e63c0c172f · inbound

TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling cites this paper.

TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-15T15:40:07.421894Z digest=sha256:8e7345c23f7e0bb505942b3999763ffaa00f6e78940f3f2b346e76041b26ae83

Observation 23f4929f-2385-44b7-8bab-2fc0103db38e · inbound

LLMs and Speech: Integration vs. Combination cites this paper.

LLMs and Speech: Integration vs. Combination AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-15T10:41:22.138517Z digest=sha256:1f7a73ec24265e73a07ee589809e93e3cf57bb0943e2d1fd924a35f2ac7fb6c7

Observation 7db8a1d4-4cd8-44ac-88a0-9bfad8030621 · inbound

LLMs and Speech: Integration vs. Combination cites this paper.

LLMs and Speech: Integration vs. Combination AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-14T20:46:17.286576Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T20:46:17.286576Z digest=sha256:b66e432f271ac78cd6b85da4fad6382c9d8c9524835a563e0b053c2002d7d516

Observation 4362face-5bed-465d-b259-41e07951cfe8 · inbound

GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking cites this paper.

GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T16:40:59.993298Z digest=sha256:463c06d70ada21203f226ec16161a49dc78cd661ffcaa6bb873313c193a978b5

Observation 97ec44a6-bc12-4425-babb-b6a8e751cd52 · inbound

Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR cites this paper.

Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T16:33:32.012025Z digest=sha256:91feb37c7e3a0092064fae9e3d5e568ddf0198a69a7bd1258bbfd70850a6bfa5

Observation f1fc358f-0d6b-4632-8dcb-cf87c439a3de · inbound

ViLL-E: Video LLM Embeddings for Retrieval cites this paper.

ViLL-E: Video LLM Embeddings for Retrieval AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T15:00:43.573409Z digest=sha256:4e6f38938e9457f8361b0f0fcbf0444dba72c4d76d3794727a43e4fa11119f3b

Observation e1475385-ea6f-4c0b-90d8-222a94cae204 · inbound

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt cites this paper.

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T12:37:17.843365Z digest=sha256:9afe172a5e81f750a4578cfbe5651ee12a2ba1d58a5233af93c9890f75f6a097

Observation 697e3bb3-066a-4ab8-86d3-3df871aa772d · inbound

Beyond Feature Fusion: Contextual Bayesian PEFT for Multimodal Uncertainty Estimation cites this paper.

Beyond Feature Fusion: Contextual Bayesian PEFT for Multimodal Uncertainty Estimation AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 23

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T08:40:13.279841Z digest=sha256:da08a8097d8d348c440cb1aabca906b1449f34818b22c524da8304b93e1d8496

Observation 20bc72ea-b452-4915-bea1-fa8d40bfdb1b · inbound

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence cites this paper.

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-09T23:03:01.356594Z digest=sha256:d0088e1baf303a25b77e5c40668eb8771b8543f1abd410e8944910853d800d7a

Observation 7086e60b-dd63-4f3e-bbd1-055b11621a4e · inbound

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions cites this paper.

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-10T13:25:50.524448Z digest=sha256:e731a2a044fb9bb283fc4665562cf8f73a76d80503edf8c47ec26829fd507dca

Observation 44c0cbd6-526b-415d-a0a5-de2ead981b81 · inbound

Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations cites this paper.

Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-08T08:16:47.522489Z digest=sha256:d0f9ca81414c83077f2b778bafe78e275872af5d99760094a0707f40e9abddac

Observation 466c03b9-9196-45a1-b0a0-dd2b53f4ce99 · inbound

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization cites this paper.

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-08T12:25:52.847432Z digest=sha256:6b2dab884130089cae3ddda5cd811d794cf4ce42c412db02068022c23eca64a5

Observation f41b4629-0450-4767-8953-2baa927df29d · inbound

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization cites this paper.

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-06-30T23:15:07.814230Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-30T23:14:32.494076Z digest=sha256:1be9c6f17224793f08ccf65ac2594ecc67a1806379f06a9a43255e8e63c4d09f

Observation aaa2c169-7f71-48d4-872e-af410ee72835 · inbound

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR cites this paper.

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-16T07:07:57.965390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-15T02:20:53.100809Z digest=sha256:98879c6d236d427dbeaecbe3e6f19f6f11c084f8f0620f2d7211ec8706fbd605

Observation abf47f2f-ba85-43ad-9797-4b86d9ab3211 · inbound

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR cites this paper.

Refining Pseudo-Audio Prompts with Speech-Text Alignment for Text-Only Domain Adaptation in LLM-Based ASR AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-06-30T20:45:03.651036Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-30T20:42:10.489048Z digest=sha256:7cb5e2919c9757cac8cf0689d0bc2d75697729d2c8f448767a16fefe1fc214c4

Observation d48dc5b6-11f7-4499-896c-35402376e954 · inbound

AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech cites this paper.

AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 66

Resolution
verified exact
local_arxiv, observed 2026-05-20T21:19:03.238948Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-20T21:14:58.814362Z digest=sha256:8dbb6f9e68a7da41effc04abe52185bf83a36c2f7846b2ecc1a64d1cacd14880

Observation aa595d77-54f3-479c-9406-a96890a868ae · inbound

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training cites this paper.

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 17

Resolution
metadata mismatch
local_arxiv, observed 2026-05-20T07:18:07.286520Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-20T07:13:29.041056Z digest=sha256:e01cc005b76b342cb5e50e326be3fc48d779cd8d70716ec0a19ca4cb080340ad

Observation d6f59265-9359-4906-b01c-3441777c4884 · inbound

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook cites this paper.

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-05-21T07:39:49.121346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-21T07:38:23.099479Z digest=sha256:ca11d614fffa5fabe5fb5bf642302c91ad06d1bb306a144a79b69a655f394e9f

Observation c07f6c49-bd15-4d72-82cf-5fcb0c2c5ab0 · inbound

Direct Translation between Sign Languages cites this paper.

Direct Translation between Sign Languages AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 24

Resolution
metadata mismatch
local_arxiv, observed 2026-05-21T05:54:40.691154Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-21T05:54:08.019738Z digest=sha256:ba50cb5f6b4d8b3cad32503f57fd29f195808c7f778022f15f4c1a12a7dd0ff2

Observation a0b94de7-b2d8-424e-a57b-dac836006370 · inbound

Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation cites this paper.

Thinking-while-speaking: A Controlled, Interleaved Reasoning Method for Real-Time Speech Generation AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 18

Resolution
metadata mismatch
local_arxiv, observed 2026-05-21T05:54:40.728191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-05-21T05:53:57.830880Z digest=sha256:5999b914717c71c94530c8a1ef24ee5571a0370bba66f413f2441e8a77c39364

Observation 6bf2e881-a9ad-4f4c-b240-68ab16f04ba1 · inbound

Do Factual Recall Mechanisms Carry over from Text to Speech in Multimodal Language Models? cites this paper.

Do Factual Recall Mechanisms Carry over from Text to Speech in Multimodal Language Models? AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 8

Resolution
metadata mismatch
local_arxiv, observed 2026-05-22T06:31:10.527590Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-05-22T06:26:19.580671Z digest=sha256:7316ac4043d7f02c5008bbe0ee92217fc1736a54fecf0fe15f467c0ed2ad7e68

Observation 26a40d52-1137-4b4b-9451-cea9a95f1966 · inbound

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs cites this paper.

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 38

Resolution
verified exact
local_arxiv, observed 2026-07-01T13:45:45.546883Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-30T22:52:43.396119Z digest=sha256:2ffb73f3141e0cdebcda0b16dc6684a37678b455aebb94d9dcd308e7e037a302

Observation b6454bdb-ef7b-4124-b450-3705762939a6 · inbound

Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention cites this paper.

Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-07-02T07:46:46.220396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-28T06:41:25.592270Z digest=sha256:926bb90bf1d854575f05f6b5dd4b536a8496e9b242187fdf1fa1370109b7c561

Observation 81d14c45-8060-4dad-901d-2ada3f13f65e · inbound

Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models cites this paper.

Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-07-02T19:47:19.978870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-27T21:16:07.007759Z digest=sha256:936123e805cf11158d8a84612447f2c2ac194217cff2a16a0b5e5e4e6ef39cca

Observation f5b65a5e-84a4-4f2a-9e20-ebb402c64e0e · inbound

Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs cites this paper.

Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-07-03T01:37:30.599502Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-27T16:26:32.594986Z digest=sha256:73952faa7762545be8908c9f9d2a9bfd0d58d6c5f1041346b17f480f736b7381

Observation 5d036bd6-9f2a-47ad-ba37-db9e90e10ce6 · inbound

ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models cites this paper.

ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-07-03T05:07:39.453814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-27T13:23:05.518547Z digest=sha256:96db679630f83536ea5131ce591549de3051aaf3f23243f0777035fcce36db09

Observation f81c375d-f0ab-4f3e-8be3-771619bdadab · inbound

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents cites this paper.

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 262

Resolution
metadata mismatch
local_arxiv, observed 2026-06-30T22:15:05.368589Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-06-30T22:11:44.891731Z digest=sha256:193e73944ad03064794af4aee92be6ecb02073ce35b1807712339b190b0d4dcd

Observation 56d51efa-b234-4d4f-a7fd-1306ac4557d8 · inbound

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation cites this paper.

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-07-03T13:18:12.795686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-27T08:18:23.182355Z digest=sha256:e9f3d5bd80c602ebd5d5368a93afcefaf342366ee105063ac3520253e8c23645

Observation 5d760ff3-1def-44b4-974b-aa41bc8ba86d · inbound

PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue cites this paper.

PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-07-03T14:48:33.550739Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-27T06:53:13.344795Z digest=sha256:b13aa913ddf6786c8956c8d2e5423fec9e40ed15df5a899e7b2992b97ee87524

Observation 6861a717-7b75-4f71-b0af-b0f9deb946a7 · inbound

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment cites this paper.

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 38

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T16:08:37.454479Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-06-27T06:05:26.735340Z digest=sha256:d6c90e960d18c596758014c5e526bf8dcac4603d43e0b7be11adca6b58ae4e9c

Observation f9c5f736-22d6-4750-9c1d-33408eed34dd · inbound

Ontology Memory-Augmented ASR Correction for Long Text-Speech Interleaved Conversations cites this paper.

Ontology Memory-Augmented ASR Correction for Long Text-Speech Interleaved Conversations AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 5

Resolution
metadata mismatch
local_arxiv, observed 2026-06-27T07:10:41.482225Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-06-27T07:06:13.658919Z digest=sha256:f98d5efe1cb7e08658231a07a35283b6f014c5a168db82492e0c083d9f2724ed

Observation 86901faf-a1a2-46f6-b70e-cc3fe8ad8977 · inbound

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation cites this paper.

AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-07-04T11:59:50.965295Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-26T07:24:01.244733Z digest=sha256:b9872672f725d6928c503598f6b36acf9b0b2edef1c0fc39834fa8dba6934e17

Observation 6113f7ee-e4b1-4231-a088-fb8bf09941d7 · inbound

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models cites this paper.

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-04T20:30:07.199395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-25T20:08:33.322532Z digest=sha256:8ee04f926557d670a51e6eb8a19e989b4bf5715e622664ca2831b8ef23feae55

Observation 4bc40f73-88d8-4062-9086-1ad926b14211 · inbound

Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs? cites this paper.

Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs? AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-04T20:30:08.194470Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-25T20:03:10.858349Z digest=sha256:3a4a2d3eeeb4c3d0e09202f9782b15dd6d16a8e6e156b74056f77df439301a24

Observation e0a2e54e-5510-462d-b657-e2650a622d66 · inbound

How to Leverage Synthetic Speech for LLM-Based ASR Systems? cites this paper.

How to Leverage Synthetic Speech for LLM-Based ASR Systems? AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-06-30T12:54:40.690218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-30T09:35:03.660671Z digest=sha256:cae40f4637002d62da2f8323ba68282406dbedfb43d3f4ad3391c06f145c9df8

Observation e6e48d35-7858-4ab0-a4bd-b50b870ffa7d · inbound

How to Leverage Synthetic Speech for LLM-Based ASR Systems? cites this paper.

How to Leverage Synthetic Speech for LLM-Based ASR Systems? AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-12T11:11:08.878850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T11:11:08.878850Z digest=sha256:979a4377dcd5644c377b93f9161d9111717177f4ca8bbae293fc72dc4330a0ca

Observation b66131a4-129b-4253-b2d9-870cc4b0d8e3 · inbound

FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars cites this paper.

FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-06-30T06:44:19.376639Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-06-30T06:38:28.718164Z digest=sha256:a28accce5516b214b741e6acf73f8c48961ab7720be4a6a47b654f3c9ee3f7ad

Observation 7d620171-28d8-4eed-974b-bfb03e61101f · inbound

Neural Audio Codec with Adjustable Token Temporal Resolution Using Sampling-Frequency-Independent Convolutional Layers cites this paper.

Neural Audio Codec with Adjustable Token Temporal Resolution Using Sampling-Frequency-Independent Convolutional Layers AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-07-03T05:17:40.016175Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-07-03T05:15:41.526048Z digest=sha256:c04e5e5f35d27859fa92787f00a8ecc63d432d08382ef51a783dd80dddfa0d3c

Observation 393dd19c-04e8-4b2a-a6b2-35c522eb076d · inbound

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track cites this paper.

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-07-03T15:08:32.410238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-07-03T15:04:02.640015Z digest=sha256:159808e1a88cd8b60642f1ab54fdd1cd9772e738276ad8adb4bb97bcd9c0c9bc

Observation 74155a37-6d9e-4e87-904f-4ae381eba66b · inbound

Unified Audio Intelligence Without Regressing on Text Intelligence cites this paper.

Unified Audio Intelligence Without Regressing on Text Intelligence AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 238

Resolution
metadata mismatch
local_arxiv, observed 2026-07-08T00:04:22.620815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=arxiv_source observed=2026-07-07T23:59:38.702609Z digest=sha256:c13a25fa1573f20953faf57f2e6c120a085141de78e1327005a49d55f2d23c01

Observation e4c9bea6-6239-4ca3-82ad-920ffef0b665 · inbound

Unified Audio Intelligence Without Regressing on Text Intelligence cites this paper.

Unified Audio Intelligence Without Regressing on Text Intelligence AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 238

Resolution
unresolved
no resolver link, observed 2026-07-11T07:46:49.059192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-11T07:46:49.059192Z digest=sha256:a5e2ac90ef9f8bded20fa2f3a67d2e8617cc98166a7c4ce9759f2f39fe549aa8

Observation f8a95b65-001a-4544-bf80-7d7c79d6f798 · inbound

When Synthetic Speech Is All You Have: Better Call GRPO cites this paper.

When Synthetic Speech Is All You Have: Better Call GRPO AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-07-10T07:56:57.817961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-07-23T06:31:01.910684+00:00.

source=pdf_text observed=2026-07-10T07:53:41.580597Z digest=sha256:515c22703d300f998bc0c1e1cb42d3ff687e42e125017c0806224c1bfb238f0e