{"as_of":"2026-08-02T18:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:009fe324e38bab768ad12974f64f2990dfdce230dd48986877b81b82ea259849","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T13:39:48.225482Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:43:34.049064Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T02:49:25.012133Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:46144b32d1b77108546e39765c23bb1ae1f45e82ed0e96ac8bf450595c966063","observation_id":"13ac8ad6-f421-41ce-b01f-54bfe7b17bbc","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T03:42:44.523919Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2507.08128"},"observation_digest":"sha256:d3cf74b29bd497fab15f84918b292879cadcaa8c327bde934329007242ca8857","observation_id":"ab37e7fe-3520-4d25-a911-e918eb5b194c","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:2fb6bfaac7c9702218c9d6fdcf80522a7059e7bb19139c4c4270c34254518f9c","observation_id":"a90d7b25-65a4-4383-92f1-9f8da6f8cceb","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-02T12:47:50.534468Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:dba569ce5e7006c43379fe3c8fdbafa7d52a1c3570d691a47c9196e26bf41916","observation_id":"e1b44793-28aa-422b-870b-ede372a11e0b","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T07:42:43.077644Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:cc925ad74fcb3df46a317042ab5fead41744e4c084ec1644101f4bcc32dc11f8","observation_id":"9cfbed63-0060-4540-9caa-d89e840fbd21","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T20:56:37.533183Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:cf233bdf9c9979b42b31bed751087bedeae0b96c753492ff2ecf5832747d88e6","observation_id":"7a3b9a6b-048d-4fbd-94c0-3d777db17cb0","resolution":{"observed_at":"2026-05-21T21:00:39.109525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2512.14234","last_updated":"2026-04-14T19:54:15Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-16T09:41:21Z","title":"ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T22:04:07.403410Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2512.14234"},"observation_digest":"sha256:c539073d6eb0f9e846403970707a37b4d33d79ff10de519eda035a2eb18f0d95","observation_id":"fbe14310-0d2a-48b2-ae6a-962ebab34970","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2512.23578","last_updated":"2026-04-16T00:22:32Z","snapshot_observed_at":"2026-07-06T22:40:17.725041Z","submitted_at":"2025-12-29T16:23:54Z","title":"Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-16T19:26:30.384474Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2512.23578"},"observation_digest":"sha256:a784c6cecf11c9458da84b00cd62f9948815711c9e2caceeee92a808146865f1","observation_id":"104e889b-1350-4146-acf2-dbed95c018de","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2602.22710","last_updated":"2026-05-06T21:24:15Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T07:34:15Z","title":"Same Words, Different Judgments: How Preferences Vary Across Modalities","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T19:31:51.996480Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2602.22710"},"observation_digest":"sha256:e18a398b046b8a7c7b63fbbea802380251fa86f801bcf90d3ff7618dec082d33","observation_id":"fa3793dc-dee9-444c-8054-be4de0c92e79","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2604.11424","last_updated":"2026-04-13T13:06:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T13:06:09Z","title":"Bridging What the Model Thinks and How It Speaks: Self-Aware Speech Language Models for Expressive Speech Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:10.832592Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2604.11424"},"observation_digest":"sha256:404bcb04a2eabc12e21b593b6b4cf2a0dda2f745ea39a0291d0df4d884301ef1","observation_id":"a8a81817-877a-4a6b-9868-775f19da4368","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-12T21:34:30.078813Z","title":"Step-audio: Unified understanding and generation in intelligent speech interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.12144","last_updated":"2026-07-01T22:34:57Z","snapshot_observed_at":"2026-08-02T05:18:11.450897Z","submitted_at":"2026-04-13T23:48:35Z","title":"VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T21:34:30.078813Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2604.12144"},"observation_digest":"sha256:9279205943fce0548edc7126d64d81fa9bdd116201a66ecaa69b69001b52ed75","observation_id":"8a072de6-a6ef-45d3-aa97-e0e955af4523","resolution":{"observed_at":"2026-07-12T21:34:30.078813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2604.12145","last_updated":"2026-04-13T23:49:27Z","snapshot_observed_at":"2026-07-30T03:55:58.250974Z","submitted_at":"2026-04-13T23:49:27Z","title":"Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T14:49:51.481873Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2604.12145"},"observation_digest":"sha256:b020f532457bd855c06ebc857975b0baa287995a12f1a7be8a87369e7c1f0cce","observation_id":"65ab0000-4558-4b3b-bc61-87cf5914c5db","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2604.12383","last_updated":"2026-05-25T07:44:26Z","snapshot_observed_at":"2026-08-02T09:36:59.041269Z","submitted_at":"2026-04-14T07:17:55Z","title":"On the Distillation Loss Functions of Speech VAE for Unified Reconstruction, Understanding, and Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:30:58.664375Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2604.12383"},"observation_digest":"sha256:8868d40a93ebc3ecf0df3923cd261770cd520f45f60c8bd0ca336e4794b9efc6","observation_id":"cdd9973b-928b-4ddb-ade5-a614c7dfdb0e","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2604.20940","last_updated":"2026-04-22T14:29:18Z","snapshot_observed_at":"2026-07-06T23:07:36.996629Z","submitted_at":"2026-04-22T14:29:18Z","title":"Sema: Semantic Transport for Real-Time Multimodal Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T22:20:55.282442Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2604.20940"},"observation_digest":"sha256:61447b2f2bb096cdbc9f7c7081762e76fc6e6cc18106c9185935fe4d3e846768","observation_id":"74e2921e-86fe-472d-9b9f-c95e31ff23d8","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.03361","last_updated":"2026-05-06T14:04:55Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:44:51Z","title":"ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T16:48:54.922606Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.03361"},"observation_digest":"sha256:6c14be153e4a8e5df770bc6ac1b225727e0e96050f659f4661f951593156ff45","observation_id":"86600281-9dfa-478c-b03d-9c1f35a28d3f","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.03361","last_updated":"2026-05-06T14:04:55Z","snapshot_observed_at":"2026-07-06T23:16:15.509235Z","submitted_at":"2026-05-05T04:44:51Z","title":"ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T18:28:16.549541Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.03361"},"observation_digest":"sha256:26d77321841b6efd4d9dedfe7ef36c4a8ead3979bdc1c83b7d79c9461db17454","observation_id":"72d91187-ece0-4e0d-8c42-5fb3f5bbe05d","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.03937","last_updated":"2026-05-05T16:27:33Z","snapshot_observed_at":"2026-07-06T23:16:49.553583Z","submitted_at":"2026-05-05T16:27:33Z","title":"MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T15:34:50.848124Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.03937"},"observation_digest":"sha256:5958fc014f89cd5c6918ea66ff039d04c9e2a7b273f0c1a87bcd4e21dcc33247","observation_id":"72c7adcb-7c33-4a2f-b2c8-e3c7d78203c3","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.04700","last_updated":"2026-05-25T06:36:12Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:52:29Z","title":"Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-08T18:08:16.051117Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.04700"},"observation_digest":"sha256:39b794ce9887940e71b6b6a53593eca5fe6ade425eb76005b978da97607bfa12","observation_id":"c1ee0ef2-4d5a-470d-b565-8b193a0b988c","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.04700","last_updated":"2026-05-25T06:36:12Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:52:29Z","title":"Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T23:46:46.296060Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.04700"},"observation_digest":"sha256:19a0acc0faa03ca393396ccd1fd763c567a958112dd3e2675cf328ac07278c92","observation_id":"d66889ff-1e86-49a8-ad0a-88aae65164a4","resolution":{"observed_at":"2026-07-01T13:15:46.063781Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.08962","last_updated":"2026-05-09T13:59:27Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:59:27Z","title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:07.344134Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.08962"},"observation_digest":"sha256:cc9f3c040add78fd98f97c511742e20eb4e77e2ace4f89ca5a967fa010b32463","observation_id":"51020bc1-d6ab-477c-b772-dc7bf98b6e5f","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T03:49:58.240883Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:31e06a001fa93a2dc78c8760185d3918fe6cf59f3a157aa2d85171b2e09f2aae","observation_id":"a6edd245-4b5b-4bd0-a826-576966cff970","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T06:06:20.658030Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:25f89f7ff7c1e77b213390b6cb5d585ca5c4ca122ff9517e02d3d5188340ace6","observation_id":"292a4020-df8c-4849-b154-45e59cd1802e","resolution":{"observed_at":"2026-05-18T13:39:48.481060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T02:41:13.583493Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:56b7db7f1b109fb93661f847347c70c5cb6f463587d4606306855ee20fe16ac3","observation_id":"bad9d523-5735-4474-afb4-04a70cb742b1","resolution":{"observed_at":"2026-05-21T02:43:55.079617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:22d54e41a1f99936a5d9cf464059ada52d269909c6c3a279579b00922d0e3efa","observation_id":"b8d0dbc3-3147-49a9-84a8-58631c65090c","resolution":{"observed_at":"2026-06-30T17:34:57.326987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.25451","last_updated":"2026-07-07T02:29:51Z","snapshot_observed_at":"2026-07-12T16:02:08.209364Z","submitted_at":"2026-05-25T06:01:45Z","title":"BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-29T23:01:14.074894Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.25451"},"observation_digest":"sha256:0d17d4517ce4e3d2f20e34b84d0d1161eab2b223933c0f3f797975435b70a498","observation_id":"909eb336-2e95-4c26-9119-bc8976c9d00b","resolution":{"observed_at":"2026-06-29T23:04:01.019293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-07-06T23:38:04.621658Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:8f396312ed4c254e7b0b51d679af1b7e12b073fa3d43a7ab3033fde54f8b4da4","observation_id":"6105dafd-069c-4ad2-bbf2-f004becb9545","resolution":{"observed_at":"2026-06-29T10:13:17.925272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:d717ebc017a57fee4150680429b8df9e68307458b5fb76d9cb488b3fe9656431","observation_id":"d4b3731c-80aa-49c6-84d1-d6fe04227c59","resolution":{"observed_at":"2026-07-02T00:56:24.977576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2606.12199","last_updated":"2026-06-10T15:19:15Z","snapshot_observed_at":"2026-07-06T23:51:07.629939Z","submitted_at":"2026-06-10T15:19:15Z","title":"Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T08:18:23.182355Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2606.12199"},"observation_digest":"sha256:f29bed30f2cba5b8d91e61b89d1abe0b0cb3c003df81ead4f72df27404413055","observation_id":"5c44acbd-621d-4bbf-b340-5a12e43a4a9a","resolution":{"observed_at":"2026-07-03T13:18:12.830247Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2606.12688","last_updated":"2026-06-10T21:22:22Z","snapshot_observed_at":"2026-07-06T23:51:35.904251Z","submitted_at":"2026-06-10T21:22:22Z","title":"M*: A Modular, Extensible, Serving System for Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T10:01:04.153130Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2606.12688"},"observation_digest":"sha256:545b834b780f31af9c5bc4c55cff292401c4b0df3161f75269ffbdc87b317071","observation_id":"989c9785-7c98-4ffd-9537-92a5aa516087","resolution":{"observed_at":"2026-07-03T10:27:56.698567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:2c7b27e62f1f594973829ef6dc20f682d517b8aa7ee318d087b03b022cf32ca5","observation_id":"da34a01a-b062-45f0-a7d8-25496182aff1","resolution":{"observed_at":"2026-07-04T02:49:25.013734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":214,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:0c1f22e2be30721587df16f697339cfb3eb34806aeac07673172b27d2d29f34b","observation_id":"1f1ee91c-9617-45ad-a0f8-c85f5226a99a","resolution":{"observed_at":"2026-07-01T11:55:42.174147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":"2502.11946","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-04T02:49:25.012133Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","venue":"cs.CL","work_id":"03de0b74-a423-4e22-be1b-76d588429220","year":2025},"citing_paper":{"arxiv_id":"2607.00363","last_updated":"2026-07-01T03:02:31Z","snapshot_observed_at":"2026-07-07T00:06:03.968882Z","submitted_at":"2026-07-01T03:02:31Z","title":"Enhancing Flow Matching with A Unified Guidance Framework for Efficient and Robust Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-02T06:36:42.174254Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2607.00363"},"observation_digest":"sha256:61173880171c1902c6b7f05e4869e7ad6a5097055afdc499149957fb47cbdf7a","observation_id":"bb9728ae-77b5-48a0-b022-301d27390afb","resolution":{"observed_at":"2026-07-02T06:56:44.326692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-07-11T19:34:49.358453Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04383","last_updated":"2026-07-29T12:04:35Z","snapshot_observed_at":"2026-08-02T08:43:31.280419Z","submitted_at":"2026-07-05T16:22:14Z","title":"Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T19:34:49.358453Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2607.04383"},"observation_digest":"sha256:96a3e578551d55705d7b351a522a48e5cf28732056ce12d061774e5ba1a86079","observation_id":"1fb345c3-36e5-48f3-8748-467b166f3ba4","resolution":{"observed_at":"2026-07-11T19:34:49.358453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-02T08:43:34.049064Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04383","last_updated":"2026-07-29T12:04:35Z","snapshot_observed_at":"2026-08-02T08:43:31.280419Z","submitted_at":"2026-07-05T16:22:14Z","title":"Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T08:43:34.049064Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2607.04383"},"observation_digest":"sha256:47441b3e3a82994028fe6173d76c434ee0e23e593e05ac76ded8a4b479f3587d","observation_id":"a5608d3f-e015-4d6e-8d61-6f737ab51a14","resolution":{"observed_at":"2026-08-02T08:43:34.049064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-01T07:12:16.034175Z","title":"arXiv preprint arXiv:2502.11946 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-01T07:12:05.600310Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:16.034175Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:5736899bfa2963813b9590c4ed383397e469cc97eb135b77249983c4ef8588aa","observation_id":"b1511d11-6966-4856-8b76-de8a36588d31","resolution":{"observed_at":"2026-08-01T07:12:16.034175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.11946/citation-record","integrity":"/paper/2502.11946/integrity","json":"/paper/2502.11946/citation-record.json","paper":"/paper/2502.11946"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Method of Paired Comparisons , author=","venue":null,"work_id":"2f9ca689-9107-43f6-a02b-572f8a5e0299","year":null},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:b17a328e79f3507ead80432eb6f8564f1b5cd24c105167f05c8974f404b2886e","observation_id":"140d72a0-7b80-44a1-a3cd-11115e1b2599","resolution":{"observed_at":"2026-05-18T13:39:48.451611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:15:06.603231Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"49ca566e-890e-44a7-b59d-f7a0424c9d40","year":2023},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:7cb89a4f6b5d355cb0dec254a91292c756386bd1aba63eed9167917232d1e919","observation_id":"59504f3a-02fa-4189-8681-69058398f4db","resolution":{"observed_at":"2026-05-18T13:39:48.418058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ICASSP 23 , year=","venue":null,"work_id":"93b25116-d8ef-4f59-8afb-2b9313ff5cbc","year":null},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:2a2cb416811bdda6404b35df233d89e1a313562c383d3820cbd88479e2a9e844","observation_id":"db7516ef-eed4-463e-9032-585405001c8b","resolution":{"observed_at":"2026-05-18T13:39:48.421909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 20th conference of the oriental chapter of the international coordinating committee on speech databases and speech I/O systems and assessment (O-COCOSDA) , pages=","venue":null,"work_id":"111f0f93-3ae2-49cd-b550-9ac6f8d76bde","year":2017},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:f82f06452afa8d05eb9574f48eea01f1105e711816ab1b6c59008f08cc2c2292","observation_id":"7999e265-947b-48c0-8b19-8ee96d91f9a3","resolution":{"observed_at":"2026-05-18T13:39:48.426351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":"34bede51-d9e8-4f2d-83d5-3b783f0d619a","year":2022},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:9f2da733a529b9e69540436537ad55a67b8f84fbcc081418e569ecfb72f05237","observation_id":"caefa079-983b-414a-b880-a257b96ff91e","resolution":{"observed_at":"2026-05-18T13:39:48.430746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"b213a34c-b52c-4b31-92c2-0ff8f4bf5e15","year":null},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:9d26e91b1edf73a3db09dc17508b4e2731215448eaba70577ee3e7da389f1407","observation_id":"09d7c2d1-71a6-44f1-ba0d-78e57b6748b4","resolution":{"observed_at":"2026-05-18T13:39:48.434662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.953781Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , volume=","venue":null,"work_id":"2eb28ea9-0c85-4a85-9083-57c764c07619","year":2020},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:45d9647492783822071a8388ec5a2c27ebd0ec9467f3985bb6f698365c5bbff6","observation_id":"e6957376-f545-4975-a7a1-1d0188dc2d06","resolution":{"observed_at":"2026-05-18T13:39:48.438169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , howpublished =","venue":null,"work_id":"901a5256-278a-4bdb-9e51-a3c4ce9cf881","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:40c53a519752b4b57358d850ceb7d3e3a945edb61dd2edfb20f4b18f8d438900","observation_id":"4c593f38-50e3-4bd9-b64d-ea8488ed5415","resolution":{"observed_at":"2026-05-18T13:39:48.441489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , howpublished =","venue":null,"work_id":"63862bc8-61ad-4c5d-90c3-8d122478cfdb","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:b5136eed2f3382c3e42a187211a61ae165556d6a9fba9e1e6a1f2e9f867931b3","observation_id":"11452c23-5220-4e88-a6f6-ef9c92a2b030","resolution":{"observed_at":"2026-05-18T13:39:48.444793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , howpublished =","venue":null,"work_id":"b4cf64b6-fbab-4ea9-bb2d-e1eab900243b","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:9cbca8fe9a529f5576b1e6d3009dd3b8880f8214b4849a83b2b07828125acb34","observation_id":"5af1c320-77b5-4d62-9907-d3a655eb9244","resolution":{"observed_at":"2026-05-18T13:39:48.448333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-07-10T10:37:01.591529Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:69a12580f5a2a7d54cec6ad69eb243a31388137cd23e703279c847b6357f3d78","observation_id":"0024d1c8-e6d0-4bcc-9ca5-e0bd5e3fc405","resolution":{"observed_at":"2026-05-18T13:39:48.408958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"\\ Terry, M E","venue":null,"work_id":"9702b225-305c-4baa-9acb-335c0e4c654c","year":1952},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:c726ce03801f11afb9fce4888a155acb526f43589a57b9ff0bcb6b0f1e9f6261","observation_id":"e92b9024-1312-4650-859e-7071f8a5f753","resolution":{"observed_at":"2026-05-18T13:39:48.455010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"APACrefauthors \\ 2024","venue":null,"work_id":"1100bd4f-7069-4f35-8c33-5bed53de6600","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:e23c5ea694d7dc1fc52d9262fd6293e051fb40ea516abf9509b8549dc430fd68","observation_id":"39d98dc5-3309-4596-8421-75a62949bf42","resolution":{"observed_at":"2026-05-18T13:39:48.458573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-07-06T20:19:30.457335Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Chen, Y","venue":null,"work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:0282031ef6ce46d479e90be3efaf8bab762a5776bd5b2b97c5da27fb2ab43e0f","observation_id":"b8366d02-27ad-4e39-8c1c-979a30e28278","resolution":{"observed_at":"2026-05-18T13:39:48.414015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12838","last_updated":"2023-08-03T04:00:16Z","snapshot_observed_at":"2026-07-06T15:30:30.381545Z","submitted_at":"2023-05-22T09:01:23Z","title":"An Enhanced Res2Net with Local and Global Feature Fusion for Speaker Verification","version":2},"cited_work":{"arxiv_id":"2305.12838","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.12838","snapshot_observed_at":"2026-07-02T00:46:24.542401Z","title":"An enhanced res2net with local and global feature fusion for speaker verification","venue":null,"work_id":"6a00e34e-603c-4caf-868d-1fbcabf2c253","year":2023},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2305.12838","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:d19565f752612f54ab6e75103ea44817fbe3b316ad582fe0d0e05407c4225ed6","observation_id":"852657ce-7c19-473e-95bf-10933b2c1e2d","resolution":{"observed_at":"2026-05-18T13:39:48.277460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-07-10T12:57:07.670593Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:1cdb4ef502e7e058b565f94a5835796a1d08430aa3c5840b2467bcbc993b98bd","observation_id":"5161f6ab-9758-4d17-9c3e-4ba99d038d7a","resolution":{"observed_at":"2026-05-18T13:39:48.283826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-07-06T18:13:55.543513Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":"2405.08295","doi":"10.48550/arxiv.2405.08295","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Han, and Katrin Kirchhoff","venue":null,"work_id":"8bf67f4d-daf4-4831-a26a-5a05116d0631","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:4df4fe9f0be3dedf5160d5d05892554873d307a7ca2aaabe708eceaede903151","observation_id":"62792d3a-d3f9-48b5-badd-2459f82d3802","resolution":{"observed_at":"2026-05-18T13:39:48.291681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:dc2228b111bee3e8cdc2938d0e2249f7121d96b52f1538f07b5cd07c14391151","observation_id":"e650777f-ee34-4217-a15e-44188e6de56f","resolution":{"observed_at":"2026-05-18T13:39:48.298794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":"2407.05407","doi":"10.48550/arxiv.2407.05407","metadata_source":"pith","pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","venue":"cs.SD","work_id":"e5ad925a-4045-49b5-b301-208bcbf3eca8","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:d9b06de9972cb9f8c3a472220fd7dad97c3de21a1536fe7a77f8e3e97b0b88a1","observation_id":"d59f2916-ea4e-4f3d-a6e4-fbe15deea9f2","resolution":{"observed_at":"2026-05-18T13:39:48.305578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-07-10T10:37:01.589123Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:8783e8e24d73c8ac412327c7be9f042f5a2b70fdf872df3f45a4a7537f36a225","observation_id":"353f164c-5839-4f53-9a37-9d6825c69551","resolution":{"observed_at":"2026-05-18T13:39:48.329726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:18aaa964096ae514b91efc8af8f8b8da566aa93b3eb88d76f0b41ba4fc7ef7ec","observation_id":"1625c794-0f28-4b4f-9768-e6e77f92aca3","resolution":{"observed_at":"2026-05-18T13:39:48.336753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:c6ceb3ee032ffce6d9c7cc23890b21a7d0e0e40dad080671f2e4452adaa806d8","observation_id":"2d3ae2fc-a0b0-4740-8024-10f7dbc5bf8e","resolution":{"observed_at":"2026-05-18T13:39:48.342720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16327","last_updated":"2025-01-27T18:59:51Z","snapshot_observed_at":"2026-07-06T20:26:55.455541Z","submitted_at":"2025-01-27T18:59:51Z","title":"LUCY: Linguistic Understanding and Control Yielding Early Stage of Her","version":1},"cited_work":{"arxiv_id":"2501.16327","doi":"10.48550/arxiv.2501.16327","metadata_source":"pith","pith_arxiv_id":"2501.16327","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Shao, H","venue":"cs.CL","work_id":"a9e367ab-e3cd-4f74-85e0-90a83a931104","year":2025},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2501.16327","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:313c74d0c8a0aecae2a4f31e8d0ca89e5e33452618c82fa400ca7b7f35e17dc7","observation_id":"7d3c2227-45f5-494e-b5d2-7890fd337c21","resolution":{"observed_at":"2026-05-18T13:39:48.348498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:59.036717+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:59.036717+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":"2206.08317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-07-02T01:06:23.909166Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":"90141a8e-b4e7-4362-8aeb-cf0206bf13b3","year":2022},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:8ef320974642dc96be393830113cf00285f4559227b111749782ecc06324adb1","observation_id":"828da4f7-53b1-4efe-aa1f-31d64759fe8c","resolution":{"observed_at":"2026-05-18T13:39:48.353222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-02T09:19:51.780849Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":"2404.00656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-07-10T20:37:34.396958Z","title":"Zhou, L","venue":"cs.CL","work_id":"440b10b8-dd06-4217-9eb2-87c1ed9e08ab","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:5e6769ff7a1d5d3f2a3dda5706ba35425ce9033d6fbad7b742137cfdf7d8d3b8","observation_id":"eb985253-43d0-4221-9e6f-15dd2dab079f","resolution":{"observed_at":"2026-05-18T13:39:48.359286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"52e4aeab-949e-41c8-9130-6032bfd97f98","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:665f8fdd5fda0e96d0f02d4806ba7a4d4d9f95c6e95d6a411775d13f898d4ba1","observation_id":"3d6e2987-5ff5-4967-b155-b0902bf75b4d","resolution":{"observed_at":"2026-05-18T13:39:48.479948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:a58c8120404a1e668df3289f3dfb65d048a5f192e6cad8df060533e4adff7b19","observation_id":"1c1befd4-35e1-49c3-86e6-7597a76b290d","resolution":{"observed_at":"2026-05-18T13:39:48.367331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cao, Y","venue":null,"work_id":"44628ccd-1576-43fc-9173-9ef333e238c7","year":2020},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:ac667f285d1e8ed0b01b471ed0d4a6bfe3b7d570915c6c66021b5681da33e824","observation_id":"d578991a-7be3-4bf3-a85b-9d47a8c05ba0","resolution":{"observed_at":"2026-05-18T13:39:48.464198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-01T16:40:44.661172Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"cited_work":{"arxiv_id":"2412.03758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03758","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6af3fedf-c886-4b9f-ac23-f93231668fed","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2412.03758","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:20e57555c9a0d1c9ba4e61f17c4386bffc3d1fb0b40bda2dda33506d0c438f8b","observation_id":"72d6ebc0-f803-40cb-830e-3e6e6ebe8195","resolution":{"observed_at":"2026-05-18T13:39:48.372483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":"2402.05755","doi":"10.48550/arxiv.2402.05755","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Costa-jussà, Maha Elbayad, Sravya Popuri, Paul-Ambroise Duquenne, Robin Algayres, Ruslan Mavlyutov, Itai Gat, et al","venue":null,"work_id":"68de0d08-16b3-465c-8cd5-3ee2f70c1524","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:288dac4b2e60c7c9ebc68418826ed46a91b3b77a0ccb0705ab2753d203221e26","observation_id":"1fe309e4-2f44-4648-913b-fde8697162f6","resolution":{"observed_at":"2026-05-18T13:39:48.378269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kim, J W","venue":null,"work_id":"24cd2461-9e2c-4691-ad25-f839974ea58b","year":2023},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:d7806ce4a4631b4181761d0a7a1612f9c3369b70778367bea727ee23e0754e2c","observation_id":"305b1f51-acbd-419f-be71-38d19996f661","resolution":{"observed_at":"2026-05-18T13:39:48.473356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Massa, F","venue":null,"work_id":"b9e96362-e8d1-4dfa-a788-926f2d099a3d","year":2023},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:972dcc9638844d442cdc0f4f9d1e4c771ec8ecfb14431673fd3efcde08b024db","observation_id":"1bc57ac3-dbca-4126-941b-3dbca3c8a708","resolution":{"observed_at":"2026-05-18T13:39:48.476643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:19b04bd9cf67eabd17e8c23c1b900c98bbb79ca8c91fd67a521271a0ecc8b73a","observation_id":"357ca484-add2-458f-aa01-810c9ea87b08","resolution":{"observed_at":"2026-05-18T13:39:48.383998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"APACrefauthors \\ 2024 1","venue":null,"work_id":"a20ecc1d-a514-4529-a37a-348b257a550b","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:6c8eb0a837288eef1d56016fd31073e3db6c2064eebbf92212e7e81023982b8f","observation_id":"724f732a-8be3-4d29-860c-d7261582ab66","resolution":{"observed_at":"2026-05-18T13:39:48.467159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"APACrefauthors \\ 2024 2","venue":null,"work_id":"f42805eb-22e6-456c-bf21-e27e8c71d902","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:cd7952c4eca5cbd8cf3018d6d7a532d45efcb67043f03f93d1658180fe0186ec","observation_id":"d233337b-4296-40e9-81d4-9167ccf7b470","resolution":{"observed_at":"2026-05-18T13:39:48.470399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:4afc4a0b9da667aa0b821cd57206a45e997c7f9539ce31aa56ed7859dfa65c75","observation_id":"eef0cf8f-ad35-490b-9f52-6c2b723ccec9","resolution":{"observed_at":"2026-05-18T13:39:48.390382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":"2408.16725","doi":"10.48550/arxiv.2408.16725","metadata_source":"pith","pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":"cs.AI","work_id":"5192d640-6f69-48bb-b5e7-c2eb57e52726","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:6f3fe8eab6426b663b361519d7bc12b413f2516a0368c3770d51bd5713a19ab1","observation_id":"4b4fd7f8-9bd0-4b4d-b44b-0a7df5b37aa7","resolution":{"observed_at":"2026-05-18T13:39:48.398368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:50.736753+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-07-06T20:01:01.384985Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":"2412.02612","doi":"10.48550/arxiv.2412.02612","metadata_source":"pith","pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","venue":"cs.CL","work_id":"1d250ff4-6ca5-4eb5-b561-48106b630d8b","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:d789689644006521646accee033d1f9cd4112c974d33ec896506f3599f0ccfe9","observation_id":"b6ccf608-f3df-4855-b006-c7740879e3e6","resolution":{"observed_at":"2026-05-18T13:39:48.403186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:58.621725+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.04275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:39:24.653945Z","title":"Disttrain: Addressing model and data heterogeneity with disaggregated training for multimodal large language models","venue":null,"work_id":"b7cc1521-f3d9-429c-b3d0-9382cdc90533","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:6e1d77334af1c1db0d8f0210b2b20b38a367acfacacc848c9a4ecd092c9e48b1","observation_id":"d15e40ce-8a13-48cd-95d1-f464427993df","resolution":{"observed_at":"2026-05-18T13:39:48.268558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":21,"verified_fuzzy":17},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 35 inbound Pith citation observations for arXiv:2502.11946."}