{"as_of":"2026-08-08T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52fdc2e7f2bcb9908ec05a2b2c633ff50d7349e3d17ce9e61af2a7dff1219297","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:03.314763Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.442888Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:8137264f068e7bcd4eca129b58dd7f59c9a0c547e403b756349f39a92174cb1b","observation_id":"c3e9db4e-2e37-4824-b626-ded906c5e4eb","resolution":{"observed_at":"2026-05-24T00:28:39.518355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:fc16a686f04d41f54fa2d14230c2082bd8c7eb1c85fb9de74c19682efcfc682e","observation_id":"b77fe242-bbaf-4c88-81c2-4b7a7701dbcb","resolution":{"observed_at":"2026-05-16T06:06:41.542344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2411.17690","last_updated":"2026-04-20T17:56:40Z","snapshot_observed_at":"2026-08-02T10:11:40.015144Z","submitted_at":"2024-11-26T18:57:29Z","title":"Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-23T17:22:23.797551Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2411.17690"},"observation_digest":"sha256:cc08248be7ff0ba8ec64ee455d7188a830ac895d9f08e6037c32a5d6168301d8","observation_id":"80f70929-f25f-419f-8682-d847b21bd568","resolution":{"observed_at":"2026-05-23T17:23:14.993539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T15:23:03.314763Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation // arXiv preprint arXiv:2305.16107","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.314763Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:0ec281c183f64dbfffdaa7983a364bf948a091b48bf07439205850e1cd992f7f","observation_id":"4f65ed92-a07d-4eba-b903-d475e502c3ad","resolution":{"observed_at":"2026-08-07T15:23:03.314763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T14:19:53.771128Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation.ArXiv, abs/2305.16107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-07T16:55:50.852560Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.771128Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:5371c6233e7d74d7467e334c65f1be1b787307388a66616068230e4d0d6a481e","observation_id":"dc3048c9-080b-4860-b527-1fcdc0f87fc5","resolution":{"observed_at":"2026-08-07T14:19:53.771128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T12:31:37.177571Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24248","last_updated":"2025-05-30T06:12:52Z","snapshot_observed_at":"2026-08-08T04:48:33.525066Z","submitted_at":"2025-05-30T06:12:52Z","title":"Probing the Robustness Properties of Neural Speech Codecs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:31:37.177571Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.24248"},"observation_digest":"sha256:241b7cf1d75fa70158cc94d7f4a07c7e302ba7d64b988f9fd0ad99968a4966d4","observation_id":"d051f26a-f4d5-4dc1-a1a0-71add2d27203","resolution":{"observed_at":"2026-08-07T12:31:37.177571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T11:58:41.093509Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:41.093509Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:df1072fd5e9ce3150a34e012373ac9947b7ccf710c1b4f4d9c717b8609846351","observation_id":"4870119f-084f-4438-ab2b-8d42b446748a","resolution":{"observed_at":"2026-08-07T11:58:41.093509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-05T16:46:49.240587Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-08T02:19:42.525581Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.240587Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:b0c91383e9b730c6609754a9bbbb1484b473df8e2a1f03a9e521db1fa059afca","observation_id":"82e7c989-1115-41fd-9d0b-10bca00a2b5c","resolution":{"observed_at":"2026-08-05T16:46:49.240587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-05T12:08:08.995130Z","title":"arXiv preprint arXiv:2305.16107 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01900","last_updated":"2025-09-02T02:43:11Z","snapshot_observed_at":"2026-08-06T20:27:40.472115Z","submitted_at":"2025-09-02T02:43:11Z","title":"Multilingual Speech Recognition Using Discrete Tokens with a Two-step Training Strategy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:08:08.995130Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2509.01900"},"observation_digest":"sha256:68e2d0114033d9c6d3012321e2134b1932b62402c93e2f1730c140765346e6a4","observation_id":"7f3ad701-dcea-4c3b-bad3-7a246672d405","resolution":{"observed_at":"2026-08-05T12:08:08.995130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-03T06:23:43.836552Z","title":"Viola: Unified codec lan- guage models for speech recognition, synthesis, and trans- lation.arXiv preprint arXiv:2305.16107,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02557","last_updated":"2026-05-29T23:48:47Z","snapshot_observed_at":"2026-08-06T12:17:33.602297Z","submitted_at":"2026-01-30T14:23:50Z","title":"The Alignment Curse: Modality Alignment Supercharges Audio Attacks via Text Transfer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:23:43.836552Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2602.02557"},"observation_digest":"sha256:ae9b8088a961ceaf5371dc3e308e5f3b1919870247735ef57d9877933d3ba4b0","observation_id":"1716ce80-123e-484e-a4f3-65e6dab0be23","resolution":{"observed_at":"2026-08-03T06:23:43.836552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T12:25:52.847432Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:5f909588b7e1314534cf82ba280f93f74c934fdb2c161d1298d6a21171602635","observation_id":"50646c69-958c-472e-8e22-427f1a6c492d","resolution":{"observed_at":"2026-05-11T19:16:08.727845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T23:14:32.494076Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:ebeaf606d51f06ca3d3aebdf5188144d65f4afe02c93e25664dadc2d9d4f964b","observation_id":"7080ea78-843c-43d7-8167-70a5797c4f18","resolution":{"observed_at":"2026-06-30T23:15:07.867939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:d4df20be85ec37bfd7f4aae5875c0b481c7a3032769c7b9ba20adff10c1ffaa1","observation_id":"982b8fe7-f2ce-4605-b23c-dcdaf6dfac20","resolution":{"observed_at":"2026-07-08T00:04:22.444307Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2305.16107 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:1e78df772ef352901f95e74ca4389cc1c1866345bded871a7792b8864c90ebfc","observation_id":"095db85d-7326-4c44-b4e9-7aebdf04307b","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.16107/citation-record","integrity":"/paper/2305.16107/integrity","json":"/paper/2305.16107/citation-record.json","paper":"/paper/2305.16107"},"outbound":[],"paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2305.16107."}