{"as_of":"2026-08-08T07:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aadd701c284afa3024bf6ef0c70f66324e8c4f803dd65d03cc1398d7065322e5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:02:51.327669Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:37:34.396958Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T20:02:51.327669Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-07T19:57:13.037270Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.327669Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:22bb588872855f3dff0ed60faa4768012f1bafa7349dac3f444827abd771aa54","observation_id":"b680d517-637c-45a4-abb2-09fcb9126e8c","resolution":{"observed_at":"2026-08-07T20:02:51.327669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:3144aacc0571cc6c132ea5a122b062b19e60f237f94aeae0da61cbb6cd5a0c36","observation_id":"eb985253-43d0-4221-9e6f-15dd2dab079f","resolution":{"observed_at":"2026-05-18T13:39:48.359286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T15:33:49.525285Z","title":"Wavllm: Towards robust and adaptive speech large language model.arXiv preprint arXiv:2404.00656, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14648","last_updated":"2025-05-20T17:36:41Z","snapshot_observed_at":"2026-08-08T04:51:39.118604Z","submitted_at":"2025-05-20T17:36:41Z","title":"Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:49.525285Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.14648"},"observation_digest":"sha256:5f5409bcb3326041dc9770f02778b9a4b83bd92bec1473be2516b3cc896183b5","observation_id":"a302002f-5c66-46e8-87fa-14ce7f01c409","resolution":{"observed_at":"2026-08-07T15:33:49.525285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:33:47.276785Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18517","last_updated":"2025-05-24T05:28:22Z","snapshot_observed_at":"2026-08-07T14:27:58.432196Z","submitted_at":"2025-05-24T05:28:22Z","title":"LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:47.276785Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.18517"},"observation_digest":"sha256:5496a62ee4d59cd4fe7db663b9f2ef389a79c907275f5962f86ca82ef33a82b3","observation_id":"23f2d7f6-e5e9-40ff-8a66-6420ed41fd2b","resolution":{"observed_at":"2026-08-07T14:33:47.276785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:24:34.067293Z","title":"Wavllm: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19037","last_updated":"2025-05-25T08:37:55Z","snapshot_observed_at":"2026-08-07T14:19:09.036755Z","submitted_at":"2025-05-25T08:37:55Z","title":"Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:34.067293Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19037"},"observation_digest":"sha256:b99e8878a68e90c6a4dc59c79c7c26da98382dea6c75a244800e5d48bef32364","observation_id":"39dc1cdd-a81c-44c2-89b0-8999099d6d37","resolution":{"observed_at":"2026-08-07T14:24:34.067293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:23:33.844445Z","title":"WavLLM: Towards robust and adap- tive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19163","last_updated":"2025-05-25T14:22:18Z","snapshot_observed_at":"2026-08-07T22:53:37.700575Z","submitted_at":"2025-05-25T14:22:18Z","title":"SpokenNativQA: Multilingual Everyday Spoken Queries for LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:33.844445Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19163"},"observation_digest":"sha256:d4d9ba08613397c7682f1f6cd25af14d51c18ba461c81059f06795a23f632a32","observation_id":"9758e2b8-382e-4345-be9b-0970a5209c8d","resolution":{"observed_at":"2026-08-07T14:23:33.844445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:15:55.743399Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-08T07:23:29.747553Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.743399Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:af50d82721d75b2a6b422da9fc2020c1a034416eb8a5dec8863502b77cf624ba","observation_id":"0f9d2bf0-68e8-41e4-8fa5-9059d48c1758","resolution":{"observed_at":"2026-08-07T14:15:55.743399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:07:22.593442Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19937","last_updated":"2026-06-16T16:14:58Z","snapshot_observed_at":"2026-08-07T14:01:17.029308Z","submitted_at":"2025-05-26T13:02:44Z","title":"ALAS: An Automatic Latent Alignment Score for Audio Language Models","version":3},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-07T14:07:22.593442Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19937"},"observation_digest":"sha256:27df0cfba8ded24c7cc95aba9970fa68a3fafb6e756f87c529a340abbbb91841","observation_id":"c481c263-ae91-4edd-b67e-aece03537254","resolution":{"observed_at":"2026-08-07T14:07:22.593442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:01:30.469502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20277","last_updated":"2025-06-05T14:53:28Z","snapshot_observed_at":"2026-08-07T13:53:27.003686Z","submitted_at":"2025-05-26T17:55:06Z","title":"OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:30.469502Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.20277"},"observation_digest":"sha256:bb5c694d83c2f4d0a0fe31670509297e0bd6d7124957176527a2de63200b2530","observation_id":"2d50605a-97c0-47c4-8eaf-39bcf667dc6b","resolution":{"observed_at":"2026-08-07T14:01:30.469502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T13:17:59.761074Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22251","last_updated":"2025-06-05T10:40:05Z","snapshot_observed_at":"2026-08-07T13:09:34.103187Z","submitted_at":"2025-05-28T11:39:59Z","title":"Evaluation of LLMs in Speech is Often Flawed: Test Set Contamination in Large Language Models for Speech Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:59.761074Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.22251"},"observation_digest":"sha256:a5fc83ba336dbb50b2b42b38aec9555fc500a5fb22dd39915c1d258a2e38fb86","observation_id":"0901f8d5-522a-4fc3-9a6d-41b30ebce6f4","resolution":{"observed_at":"2026-08-07T13:17:59.761074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T11:37:06.539254Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model.arXiv preprint arXiv:2404.00656, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01808","last_updated":"2025-06-02T15:52:57Z","snapshot_observed_at":"2026-08-07T11:30:46.088140Z","submitted_at":"2025-06-02T15:52:57Z","title":"NAVER LABS Europe Submission to the Instruction-following Track","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:06.539254Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2506.01808"},"observation_digest":"sha256:1758d78b627b337ce858a7929a1e9eadb0f2a5a62d64fe6020326f884a315686","observation_id":"e44347e4-7050-40ad-adc0-08546cffa511","resolution":{"observed_at":"2026-08-07T11:37:06.539254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-06T23:41:49.527166Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17351","last_updated":"2025-06-20T01:28:43Z","snapshot_observed_at":"2026-08-07T18:45:57.210896Z","submitted_at":"2025-06-20T01:28:43Z","title":"Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:49.527166Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2506.17351"},"observation_digest":"sha256:9d543a3b6a11c92b413c6436b6a3b805213e209a51042d9a138e68c115878208","observation_id":"30911dfa-cd1f-4296-b876-2eec645a6286","resolution":{"observed_at":"2026-08-06T23:41:49.527166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-06T19:46:11.712860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06256","last_updated":"2025-07-07T07:29:52Z","snapshot_observed_at":"2026-08-08T05:08:17.649592Z","submitted_at":"2025-07-07T07:29:52Z","title":"Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.712860Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2507.06256"},"observation_digest":"sha256:4fdfa4d3f6f9cd28f88266bd280f314f0c055caffdd0d16ddefe7c0be2b0dc29","observation_id":"4fccb077-0b67-487e-996f-acac6bec9f86","resolution":{"observed_at":"2026-08-06T19:46:11.712860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-05T13:03:14.524557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00988","last_updated":"2025-08-31T20:51:59Z","snapshot_observed_at":"2026-08-08T06:51:32.296033Z","submitted_at":"2025-08-31T20:51:59Z","title":"A Unified Denoising and Adaptation Framework for Self-Supervised Bengali Dialectal ASR","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:03:14.524557Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2509.00988"},"observation_digest":"sha256:9870539adfb23100b808c08c9cb5940958fce3cb33927ea5568ffafd2776c324","observation_id":"eddac622-e3c2-4186-a8bb-b36bb8e41ac1","resolution":{"observed_at":"2026-08-05T13:03:14.524557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-07T01:53:38.136292Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:34d5f6146ce1d79e8c9098c669057276d678cab977aa2f9664f8f3165781d376","observation_id":"3a65ff3c-010c-48c3-a432-af3a74704ccc","resolution":{"observed_at":"2026-05-21T22:24:23.512556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-05T13:53:24.835833Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:24.835833Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:feca6da59e053c16efe9f1af1501656c0d3367789a3bdbd18dea96eaf3538fd8","observation_id":"9bf4cc41-8be5-499a-ab66-a0aa23b369a8","resolution":{"observed_at":"2026-08-05T13:53:24.835833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2606.12199","last_updated":"2026-06-10T15:19:15Z","snapshot_observed_at":"2026-08-07T21:59:04.835770Z","submitted_at":"2026-06-10T15:19:15Z","title":"Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T08:18:23.182355Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2606.12199"},"observation_digest":"sha256:f7a1dbc2aae1eaadbcb82f66d5bcb2a7eb679098a4436d8634185774894ed184","observation_id":"972007dd-402b-4d7e-aa27-778be2800211","resolution":{"observed_at":"2026-07-03T13:18:12.804002Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2606.26824","last_updated":"2026-06-25T10:04:35Z","snapshot_observed_at":"2026-08-07T18:06:46.620012Z","submitted_at":"2026-06-25T10:04:35Z","title":"wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T02:49:35.819155Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2606.26824"},"observation_digest":"sha256:7db372532593563c18d5f3d8cde53b6f14bb2d748aff05cf45c9bd984dfd0cf0","observation_id":"2dab21e0-b00b-4940-96c8-083110bdb8a5","resolution":{"observed_at":"2026-07-04T14:39:58.380231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T16:59:50.615875Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:f94d4f4d6ceeb68bf282aa78b4050f58b606a2c435a320ac047a28634f8e198c","observation_id":"8e2f9176-2dbf-40c1-99b9-f4b58f4d0be4","resolution":{"observed_at":"2026-07-02T17:07:12.183604Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-04T04:34:50.946446Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T04:34:50.946446Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:971705f3928454edae5bb0d596f8a07da98d90d288734f6c8ecd7b21eb048dfb","observation_id":"c774a0a5-b0d9-4324-803a-1a86053f725e","resolution":{"observed_at":"2026-08-04T04:34:50.946446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2607.01960","last_updated":"2026-07-02T09:52:08Z","snapshot_observed_at":"2026-07-07T00:07:28.231599Z","submitted_at":"2026-07-02T09:52:08Z","title":"NAVER LABS Europe Submission to the Instruction-following 2026 Short Track","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-03T15:04:02.640015Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.01960"},"observation_digest":"sha256:3829133615a11055924842f95a8017fa46d3a882f58eeff3ba7f128d87c57626","observation_id":"63af21e0-5f45-421c-b25e-25dcd9573349","resolution":{"observed_at":"2026-07-03T15:08:32.423186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2607.05365","last_updated":"2026-07-06T17:42:59Z","snapshot_observed_at":"2026-08-02T09:53:17.632449Z","submitted_at":"2026-07-06T17:42:59Z","title":"SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-07T14:53:07.512543Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.05365"},"observation_digest":"sha256:242627cf6017db5a9a360b8a4a572ac69a274ff3471c264155f3769c947b7367","observation_id":"6e4c7289-d80d-4a0b-906f-af201dded00d","resolution":{"observed_at":"2026-07-07T14:53:55.789976Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-11T04:47:56.963554Z","title":"arXiv preprint arXiv:2404.00656","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05623","last_updated":"2026-07-15T07:17:15Z","snapshot_observed_at":"2026-08-02T08:30:01.168064Z","submitted_at":"2026-07-06T20:31:41Z","title":"NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T04:47:56.963554Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.05623"},"observation_digest":"sha256:58734233040b6f340d997c88969803297d71906c6e2f82be8319d928336797ed","observation_id":"f1d48f1e-066c-4610-8783-4b66cd7f5a09","resolution":{"observed_at":"2026-07-11T04:47:56.963554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-02T08:30:02.391299Z","title":"arXiv preprint arXiv:2404.00656","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05623","last_updated":"2026-07-15T07:17:15Z","snapshot_observed_at":"2026-08-02T08:30:01.168064Z","submitted_at":"2026-07-06T20:31:41Z","title":"NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:30:02.391299Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.05623"},"observation_digest":"sha256:83b3449e6da76876627cb1db846e40d0efdd82adabece16d120deadd3970de8e","observation_id":"afeac008-e22d-4945-a197-29c902ed6a3c","resolution":{"observed_at":"2026-08-02T08:30:02.391299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2607.06827","last_updated":"2026-07-07T21:45:04Z","snapshot_observed_at":"2026-07-11T23:18:39.332726Z","submitted_at":"2026-07-07T21:45:04Z","title":"Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T20:30:11.127007Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.06827"},"observation_digest":"sha256:b2f51f8a9961399874f5727c523db32efee94dfe1195dd17cb52a05345a6a844","observation_id":"3fe8e6f2-f109-49ef-bf16-6fcddfd29a9d","resolution":{"observed_at":"2026-07-10T20:37:34.398583Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-01T07:18:27.114855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21496","last_updated":"2026-07-23T16:43:12Z","snapshot_observed_at":"2026-08-06T07:15:08.007377Z","submitted_at":"2026-07-23T16:43:12Z","title":"Toward Generalizable Cognitive Impairment Detection with Speech-Based Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T07:18:27.114855Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2607.21496"},"observation_digest":"sha256:5d988c162b277c75cbd609cf05682ea3641b54d31dab21a22cbf96482e5f6d86","observation_id":"9d169afa-8bba-4e92-95e4-1b1b83d6a072","resolution":{"observed_at":"2026-08-01T07:18:27.114855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.00656/citation-record","integrity":"/paper/2404.00656/integrity","json":"/paper/2404.00656/citation-record.json","paper":"/paper/2404.00656"},"outbound":[],"paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T03:00:53.438875Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2404.00656."}