{"as_of":"2026-08-06T18:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:590c5d5fa44d7443cdc0f758453bd0e160228535a858b624595edbb5fdc063e6","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T02:52:22.610397Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:13:56.110991Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T17:18:44.075741Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"cited_work":{"arxiv_id":"2605.23463","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.23463","snapshot_observed_at":"2026-07-03T17:18:44.075741Z","title":"StepAudio 2.5 Technical Report","venue":"eess.AS","work_id":"9eca0e26-c3a4-45a5-b480-515455f200b2","year":2026},"citing_paper":{"arxiv_id":"2606.19381","last_updated":"2026-06-14T07:56:36Z","snapshot_observed_at":"2026-07-06T23:54:41.980696Z","submitted_at":"2026-06-14T07:56:36Z","title":"Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T04:19:13.689689Z"},"links":{"cited_paper":"/paper/2605.23463","citing_paper":"/paper/2606.19381"},"observation_digest":"sha256:ee3026dd5b50f0c35cdafdea6976739fdac3d97d60a470a2d1f88a4d5d298be1","observation_id":"789faeb4-f885-46e4-a64f-704563c7b88e","resolution":{"observed_at":"2026-07-03T17:18:44.077038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23463","snapshot_observed_at":"2026-08-03T10:13:56.110991Z","title":"arXiv preprint arXiv:2605.23463 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.110991Z"},"links":{"cited_paper":"/paper/2605.23463","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:682b0cb92719fb5720372acea7a819f95609509892dfcde34c9b523904716350","observation_id":"a05dba3a-3f4d-45fe-ad13-fa4c033e29f2","resolution":{"observed_at":"2026-08-03T10:13:56.110991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.23463/citation-record","integrity":"/paper/2605.23463/integrity","json":"/paper/2605.23463/citation-record.json","paper":"/paper/2605.23463"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Connectionist temporal classification","venue":null,"work_id":"65a0e422-e447-49f4-8c67-22aa1c4faf3d","year":2012},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:d9d89c48591bf59d201c5672e2213523dab51865ba8c03ef979916c08abe4a20","observation_id":"086e75aa-a6ef-417f-b944-038c36ad785f","resolution":{"observed_at":"2026-05-25T02:56:35.361557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-07-06T02:59:58.238741Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":"1211.3711","doi":"10.48550/arxiv.1211.3711","metadata_source":"pith","pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sequence Transduction with Recurrent Neural Networks","venue":"cs.NE","work_id":"4553c1f9-9627-48f1-bcb4-69ce67d2ad80","year":2012},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:37a9a9f12ac72403b977e7dca4e70ecc098a4f9fa4da4fb4e0c55552f561b654","observation_id":"14ae607c-95e5-44d1-bdf8-4b5aacb3f70c","resolution":{"observed_at":"2026-05-25T02:55:16.521251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.01211","last_updated":"2015-08-20T00:38:43Z","snapshot_observed_at":"2026-07-06T04:25:55.309703Z","submitted_at":"2015-08-05T20:17:58Z","title":"Listen, Attend and Spell","version":2},"cited_work":{"arxiv_id":"1508.01211","doi":null,"metadata_source":"pith","pith_arxiv_id":"1508.01211","snapshot_observed_at":"2026-07-04T13:29:51.152577Z","title":"Listen, Attend and Spell","venue":"cs.CL","work_id":"bb2589f9-8410-4374-a31f-7e5031750959","year":2015},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/1508.01211","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:68629928e5510872ef3a17001701826a49744589011269fb1fda47cd01a8c50e","observation_id":"6eab5b32-aab8-4e2a-a3fe-7d9fdbfc6b2a","resolution":{"observed_at":"2026-05-25T02:55:16.509973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"611d6878-298f-4cf4-b841-932131b8bfaa","year":2023},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:952c368b9420a7b406f93b85b4eca707ed33a46fe983907478be26cc01191f2e","observation_id":"5eeac4c3-be4e-46d5-b52c-f412f6d551a2","resolution":{"observed_at":"2026-05-25T02:56:35.353701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18184","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.819917Z","title":"VIBEVOICE-ASR technical report","venue":null,"work_id":"8c3744fb-dfff-4f53-8445-4806dbf5929a","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:661002dff81d0d53bcdce463ccbd158c81e67419e2f65269d4e2628d6e56e2f8","observation_id":"df029add-8e4b-4238-ab59-6d9334d01e84","resolution":{"observed_at":"2026-05-25T02:55:16.526933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T13:21:06.298615Z","title":"Fun-ASR technical report","venue":null,"work_id":"0d0144d6-599f-4fc5-a3ac-d35c144cdd41","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:d62aa202d3f42d1c5f23e16eebd1d3e4bac138586988e8bb07263f9709003172","observation_id":"5e20d531-5ce5-478e-afeb-3a15edf3fa37","resolution":{"observed_at":"2026-05-25T02:55:16.532217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":"2407.04675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-07-05T13:21:06.342183Z","title":"Seed-asr: Understanding diverse speech and contexts with llm-based speech recognition","venue":"eess.AS","work_id":"c5c60033-9068-454d-8df1-52efb011f98b","year":2024},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:0d7139c4d5aec47cd02e17bcd75092841822b125aae917a8c52ca483c764a620","observation_id":"91001d88-a7f2-4930-8541-dc76486a95f5","resolution":{"observed_at":"2026-05-25T02:55:16.515698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:d38fadb54043430dcd2f2f2c14026a244750959a8576cfc9c8380c56d0ef935b","observation_id":"9fd13268-45a3-43f5-a739-bfc06b0f025e","resolution":{"observed_at":"2026-05-25T02:55:16.483222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2507.16632","doi":"10.48550/arxiv.2507.16632","metadata_source":"pith","pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Audio 2 Technical Report","venue":"cs.CL","work_id":"2317bc9f-2d58-4e53-b7ea-804337e9fdef","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:90acad101f777216641f6d4aa21981653bc06241c81654924549023a1f86e049","observation_id":"ae35f11f-b45b-4570-a385-d37c6d821ce6","resolution":{"observed_at":"2026-05-25T02:55:16.487852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:eeee58a1e8c0d7149cf6b2752f5d9d70d0b5921b81687d2ae8d6794901e3a8cd","observation_id":"713f12d6-bd4a-407b-8965-ba391750f8e0","resolution":{"observed_at":"2026-05-25T02:55:16.441821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"cited_work":{"arxiv_id":"2605.12034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12034","snapshot_observed_at":"2026-06-30T17:34:57.376694Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","venue":"cs.MM","work_id":"3d44bbf2-61a6-4226-b3f4-c18dfb8f1aac","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2605.12034","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:35f5e62a37a33096fdc85bf31590de4510ee57d23518edaeb6b6a0965709ca0d","observation_id":"0953c54f-6449-4679-b7a8-a5382add346c","resolution":{"observed_at":"2026-05-25T02:55:16.477459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":"02a9e694-304e-4f45-beff-168099a50fa3","year":2024},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:f553bdd234997d862edca0625514c53e8bf2795c2190febb51a427aa0292b7ad","observation_id":"fc8064bb-97ff-403c-9dfd-eedabf2c2453","resolution":{"observed_at":"2026-05-25T02:56:35.371149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiolm: a language modeling approach to audio generation.IEEE/ACM transactions on audio, speech, and language processing, 31:2523–2533","venue":null,"work_id":"ec7df9ed-3b74-45ef-8d96-020ad7bda143","year":2023},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:b390edc310cbb359b625600db253febe7605a8d41d1ee1ea17a068b236125739","observation_id":"57515c3d-9c92-4e8e-9189-36d3eb900b8a","resolution":{"observed_at":"2026-05-25T02:56:35.374738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent advances in speech language models: A survey","venue":null,"work_id":"a7638ff3-4055-45dd-96ca-1357b68b9cef","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:698af2c071d71777d632cb98437953860abc0be9c952586482bd8bd20b88910b","observation_id":"350987e5-fa75-45d3-8571-0bcdb7a12996","resolution":{"observed_at":"2026-05-25T02:56:35.379842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paralinguistics-aware speech-empowered large language models for natural conversation.Advances in Neural Information Processing Systems, 37:131072–131103","venue":null,"work_id":"ee075700-933d-478d-965f-26d7ec01c2d4","year":2024},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:0f72a595569e3ff3d2779fea85e5b6ce2c1ac9c0ca890313d6c7392de5a6b2a3","observation_id":"c59d0276-31d1-4f4f-b648-9517b90875b5","resolution":{"observed_at":"2026-05-25T02:56:35.383483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen LLM","venue":null,"work_id":"34c9b982-aa2c-4ea9-9354-b699e38252b7","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:e37d21524ef8a932e8e7caa0c8eb637ae53e43f8880b867a98fe62f305982bb3","observation_id":"0caf796e-e190-4ba0-b488-fdd8162c462c","resolution":{"observed_at":"2026-05-25T02:56:35.389815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.00303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depflow: Disentangled speech generation to mitigate semantic bias in depression detection","venue":null,"work_id":"0c5b8fd4-85b1-4907-9e8e-fac38388e59e","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:7a06c6f775089ca939e076d6fe2354b18a8868d99011bf20c94f288c7f7ecb0c","observation_id":"2c452943-18a0-4a86-b196-e4b4c9f47119","resolution":{"observed_at":"2026-05-25T02:55:16.431713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A new approach to extract fetal electrocardiogram using affine combination of adaptive filters","venue":null,"work_id":"9f125258-8226-454f-88ff-a1ca6e0235c9","year":2023},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:bb8b526c38850ea011188aa5e6fc1a88238b6f7f1ad6870ffc44a21178672be9","observation_id":"9b34497f-a2a0-43e7-a002-f32ab6dbe7ee","resolution":{"observed_at":"2026-05-25T02:56:35.367549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T17:34:57.362731Z","title":"Multi-bench: A multi-turn interactive benchmark for assessing emotional intelligence ability of spoken dialogue models","venue":null,"work_id":"67e3348d-1a9b-4869-bcf0-a69f0d6c72e1","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:3c511c6de6fe995c04e8d948d0889ae0bb42ead54883b7aecce6d4bdf3665442","observation_id":"e2be10c6-91b2-40e5-abf2-c6973cc89d8b","resolution":{"observed_at":"2026-05-25T02:55:16.436892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:cdcd8bc2db6e6f39fb4ac3c2dc9405078dd2a5d392e716cb24b590820178ceb9","observation_id":"be94f0cd-1a89-49c5-9cc2-8a8b361e35e7","resolution":{"observed_at":"2026-05-25T02:55:16.463143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09592","last_updated":"2026-05-10T15:21:35Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:50:59Z","title":"Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models","version":2},"cited_work":{"arxiv_id":"2510.09592","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.09592","snapshot_observed_at":"2026-07-03T17:18:44.087054Z","title":"Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models","venue":"cs.CL","work_id":"15e53184-58e7-4867-8d1f-5e833acbd01e","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2510.09592","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:4f2b4d1bf52649fda749d7fe38cc42f0eec3ecdf00cba7cd9a8d53d596c824cc","observation_id":"a0b65575-9b51-44bd-9706-5a1487dd1153","resolution":{"observed_at":"2026-05-25T02:55:16.472393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T15:37:06.838629Z","title":"Chronological thinking in full-duplex spoken dialogue language models","venue":null,"work_id":"4c63fc14-bec8-4822-b330-9def61feaae9","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:66fd683bb9b3a42b8925b04cd506d88adda1baa5fe1b41e1670977ed9c86fa3f","observation_id":"3f84023c-a4ee-4d5f-bc42-95785eff768a","resolution":{"observed_at":"2026-05-25T02:55:16.505381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Duplexsla: A full-duplex spoken language model with synchronized speech, language, and action","venue":null,"work_id":"acf01bd3-e3be-4833-a895-855bafaf507f","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:49cc0550dc5ad7d33c3b3371d11b616f1bf9860903aa3f3ec85e9bc749c02fa9","observation_id":"63082297-3c5c-4db9-aca2-327d8a2db705","resolution":{"observed_at":"2026-05-25T02:56:35.386641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:49.616170Z","title":"Mamba in speech: Towards an alternative to self-attention.IEEE Transactions on Audio, Speech and Language Processing","venue":null,"work_id":"e27c8320-3484-4724-b0c5-beb133f6abae","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:30476b1a023924433f2354723b6dbbb7bb3a79d8c905aa1f7e9a55acd9de0d78","observation_id":"20c44ea9-682f-4e47-ab7b-0581c94a5b9b","resolution":{"observed_at":"2026-05-25T02:56:35.392860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:49.621937Z","title":"Code-switching speech recognition under the lens: Model-and data-centric perspectives.IEEE Transactions on Audio, Speech and Language Processing","venue":null,"work_id":"fa7055d6-3e6d-41b7-b87a-09fbf01825de","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:d58b322e4f0ede215bbeb0a4906199086954bc78d769709f8242c1593f01aeb6","observation_id":"df5d89ca-d3a6-4fe0-b631-566a1f8999a9","resolution":{"observed_at":"2026-05-25T02:56:35.396848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15848","doi":"10.48550/arxiv.2511.15848","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-audio-r1 technical report","venue":"arXiv (Cornell University)","work_id":"80b24600-9960-4df9-97b2-66714cfd73f5","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:8263ed65b4d6e7012501dc2fbacec2325a9a590ae8e3a35b2c9170636fafab80","observation_id":"413f7c81-0419-41ee-9e47-258ff55a93e6","resolution":{"observed_at":"2026-05-25T02:55:16.500260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25719","last_updated":"2026-05-31T23:35:54Z","snapshot_observed_at":"2026-08-03T00:45:36.849248Z","submitted_at":"2026-04-28T14:44:30Z","title":"Step-Audio-R1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2604.25719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.25719","snapshot_observed_at":"2026-06-30T17:34:57.320451Z","title":"Step-Audio-R1.5 Technical Report","venue":"eess.AS","work_id":"74d860ea-f21d-4baf-8642-60fa524014ca","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2604.25719","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:26fe5466774d8c44ba534e7c80434d0f39dfa5ed065ab873f8d48b0c139f5da8","observation_id":"61a5a62a-d7e4-43fe-b7da-eb8aaabcd02b","resolution":{"observed_at":"2026-05-25T02:55:16.494617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Park, William Chan, Yu Zhang, et al","venue":null,"work_id":"e695952e-8217-4783-a337-7810935aa5e1","year":2019},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:10f18c17b10c60c1789aa3e6b70b4bc876c60a9f5be62e6a5b0bbdffceed6066","observation_id":"6bef68ea-45ae-41f8-adba-1faf1a74e168","resolution":{"observed_at":"2026-05-25T02:56:35.402758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dfc0fcca-5e22-4fa1-a2be-e1a8ed96dd12","year":1997},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:8d004653391c3e69c7cbe758b7e5fb2f2bed1864cb5a05fe771949f1d672d271","observation_id":"1a6e80ea-7904-4bf1-ba00-a51938a47ef3","resolution":{"observed_at":"2026-05-25T02:56:35.406529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AIShell-1: An open-source mandarin speech corpus and a speech recognition baseline","venue":null,"work_id":"1f6b4972-6369-46b6-859e-a79a943d7a83","year":2017},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:3c939bb47b307a1ff6dc7cbc14343c4b4bfe24623cc3b9f519f79874582d5b19","observation_id":"697f37fc-63c2-408f-8eb4-c9cef2fdab7e","resolution":{"observed_at":"2026-05-25T02:56:35.409728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-07-06T06:58:27.332918Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":"1808.10583","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-07-05T13:21:06.309631Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","venue":"cs.CL","work_id":"123cad45-dfd0-4b02-a99a-47d962dc2ab4","year":2018},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:bf7c0552fb03a4db4ffb48b0351713bf61e24153eb402dcc24948786137e825d","observation_id":"01cf541e-269d-45f9-9451-c73612401bd9","resolution":{"observed_at":"2026-05-25T02:55:16.451910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WenetSpeech: A 10000+ hours multi-domain mandarin corpus for speech recognition","venue":null,"work_id":"f731d104-6a5a-44f0-9e08-f4229aaf9e9e","year":2022},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:ff7233401431b4a25a1af86908833848854b42f3fd74a21d2ba62c59363c9dd8","observation_id":"8d2d211f-feb6-4434-83a8-468b733a68fc","resolution":{"observed_at":"2026-05-25T02:56:35.422611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12446","last_updated":"2022-05-25T02:29:03Z","snapshot_observed_at":"2026-07-06T13:13:37.143547Z","submitted_at":"2022-05-25T02:29:03Z","title":"FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech","version":1},"cited_work":{"arxiv_id":"2205.12446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.12446","snapshot_observed_at":"2026-07-10T20:37:34.442695Z","title":"FLEURS: Few-shot learning evaluation of universal representations of speech","venue":"cs.CL","work_id":"591017b1-e3a5-4f06-9d81-998d68d87365","year":2022},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2205.12446","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:98c679476edb3e4739c5409ff07f8dd855a8baf374fdd8ab6825846d1fd39a49","observation_id":"49a49c25-9c27-466e-ae3e-3b83d2481bb9","resolution":{"observed_at":"2026-05-25T02:55:16.447086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LibriSpeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"b6dde076-ba15-4626-aaa7-eba8df0299e8","year":2015},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:dc4a78ca696ff22a8212bf1f76469323521247ab5f1aa488c159851c49c665d5","observation_id":"01041449-4711-47c4-8cb1-e0f0585030bc","resolution":{"observed_at":"2026-05-25T02:56:35.425885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":"1fb36e07-8d87-4f1a-8284-9622f0851297","year":2020},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:c9e616f6351127509136366886ce58af3ead10309af33a3b1e3d0128297094e6","observation_id":"8f1435fe-f4a1-4c63-b748-925370e9a75e","resolution":{"observed_at":"2026-05-25T02:56:35.419215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oxpopuli-cleaned-aa: Cleaned ground truth transcripts for voxpopuli english test set","venue":null,"work_id":"5c7e9315-2086-4a80-89ae-6e2e3397d393","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:2349d4fce244dc9b019fedca67526396476c9adf54de97088dcc40e94acd1063","observation_id":"6c171711-18e3-4de3-9885-1f7b8eac9738","resolution":{"observed_at":"2026-05-25T02:56:35.415860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Earnings22-cleaned-aa: Cleaned ground truth transcripts for earnings22 english test set","venue":null,"work_id":"0fb17f00-410b-4fe0-90a8-5f1992d647f7","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:fe7eae167149fa617a177a79eb707e01fcb6c0e664cdbc0bd3be455cdf182826","observation_id":"9d1bfb95-8e08-47a5-b14c-f7e005da005c","resolution":{"observed_at":"2026-05-25T02:56:35.412796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:39:38.491718Z","title":"Step-audio-editx technical report","venue":null,"work_id":"72708f56-8cbe-49d9-a132-7fb2895ef10e","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:10f6e1310176f399917c94542dbf7b2c5c54fdf00d70c191e8ef180971979fad","observation_id":"4534e43b-4358-4eec-be62-10f5a597de92","resolution":{"observed_at":"2026-05-25T02:55:16.458036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:955b6b385ce02741183d556bd6fb89371e7b7ab4d5bff7f5e31471e9f2ec65c8","observation_id":"ae24bc43-fe61-4d31-a7a5-2443a782c1a9","resolution":{"observed_at":"2026-05-25T02:55:16.467568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":18},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2605.23463."}