{"as_of":"2026-08-10T03:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4995187fa2d3312a54c5b7e150a9a4a640768d9b6ac935590584952bec59576a","coverage":[{"denominator":10,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:26:20.100595Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.31521/citation-record","integrity":"/paper/2605.31521/integrity","json":"/paper/2605.31521/citation-record.json","paper":"/paper/2605.31521"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:00a350bc02e8929668e1309dbd7b0a64a9c057adc15ac26216f101676addd61d","observation_id":"83e3927a-75e6-426b-9fb7-1caeefb740a1","resolution":{"observed_at":"2026-06-28T22:32:44.573959Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:26:20.100595Z","title":"In2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), pages 1–8","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:242df7b515eb00d67b28e26fcef2d44b1f5ae43ab48407325595079e6524449f","observation_id":"74bfcf32-55f1-46f8-83b2-7c9ea3653a36","resolution":{"observed_at":"2026-06-28T22:26:20.100595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:26:20.100595Z","title":"In Advances in Neural Information Processing Systems, volume 38","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:b97e3e6f7c8aa676a59230228524ac6747618885f9258dfc80a397663e5d0051","observation_id":"71943c2b-405d-41df-b53c-942ac987945e","resolution":{"observed_at":"2026-06-28T22:26:20.100595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":"2406.14294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-07-09T06:36:02.212511Z","title":"DASB - Discrete Audio and Speech Benchmark","venue":"cs.SD","work_id":"bad19d0f-5776-4401-9759-d4523eed24c7","year":2024},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:fb7f7d61c97f335a8fadc35d223d30fe68460fee27c81e166c1f8efa1b1bf509","observation_id":"c1637969-f234-4c78-9fe8-b2521552ec14","resolution":{"observed_at":"2026-06-28T22:32:44.576420Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:0f12778ffede956a89ea9502bc6b448c1d2a18068ceff484e4923d0b9d32e320","observation_id":"64c50274-e662-4a36-9526-152e64fe279a","resolution":{"observed_at":"2026-06-28T22:32:44.578700Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":"2305.02765","doi":"10.48550/arxiv.2305.02765","metadata_source":"pith","pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec","venue":"cs.SD","work_id":"b1993988-663c-4e53-a60e-4a29006bc48a","year":2023},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:3fdc94287b3c1f70684af3c75cb19fd659e3d0f9a8a4c26a1f1157580842e9b7","observation_id":"cb4ffe68-c56e-4813-9e8f-8f240219b418","resolution":{"observed_at":"2026-06-28T22:32:44.571649Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:26:20.100595Z","title":"We use the officially released most powerful large, 75Hzvariant in our experiments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:d70f15506606da9b083ea9237b1c2367835cb5f69ed8ff276056328af7b3f181","observation_id":"6d92705c-b51f-4932-bc65-5c4c00c3b1a4","resolution":{"observed_at":"2026-06-28T22:26:20.100595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:26:20.100595Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:991cd13479877a73a46388ddb0436b449c51a658bfe449553b6cddda9fb502a0","observation_id":"fc386693-3f73-492d-bf42-d91c96da797e","resolution":{"observed_at":"2026-06-28T22:26:20.100595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:26:20.100595Z","title":"It can compress speech into highly efficient discrete tokens at a significantly lower frame rate while ensuring robust semantic preservation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:147bff87ab1555ffe5dfd32802f0079d04057a760f453cacadbd26007637f1e9","observation_id":"fb2df804-748d-496d-afa7-1b58eaa91b9b","resolution":{"observed_at":"2026-06-28T22:26:20.100595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:26:20.100595Z","title":"Perfect Consistency","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:603393c354b0892c108593955d75968b48f74f75cc582e07657a79b95cdabaef","observation_id":"a9f19da0-24d5-403d-bb7b-81b4b6072ccf","resolution":{"observed_at":"2026-06-28T22:26:20.100595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T15:12:30.458872Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception"},"reference_resolution":{"displayed":10,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":10},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 10 of 10 outbound references and 0 inbound Pith citation observations for arXiv:2605.31521."}