{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NR56754HXGIYXBIL7ATEKYSNTJ","short_pith_number":"pith:NR56754H","schema_version":"1.0","canonical_sha256":"6c7beff787b9918b850bf82645624d9a73a47cb768897d4f7d9f8eea03c24548","source":{"kind":"arxiv","id":"2502.09940","version":1},"attestation_state":"computed","paper":{"title":"A Preliminary Exploration with GPT-4o Voice Mode","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.SD","eess.AS"],"primary_cat":"cs.CL","authors_text":"Chen-An Li, Chien-yu Huang, Chih-Kai Yang, Hung-yi Lee, Wei-Chih Chen, Xuanjun Chen, Yu-Xiang Lin","submitted_at":"2025-02-14T06:34:08Z","abstract_excerpt":"With the rise of multimodal large language models, GPT-4o stands out as a pioneering model, driving us to evaluate its capabilities. This report assesses GPT-4o across various tasks to analyze its audio processing and reasoning abilities. We find that GPT-4o exhibits strong knowledge in audio, speech, and music understanding, performing well in tasks like intent classification, spoken command classification, semantic and grammatical reasoning., multilingual speech recognition, and singing analysis. It also shows greater robustness against hallucinations than other large audio-language models ("},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.09940","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-02-14T06:34:08Z","cross_cats_sorted":["cs.SD","eess.AS"],"title_canon_sha256":"202a163106ef4ee81fd622b432c77880f60dc58f2df33818f2d156d13768958f","abstract_canon_sha256":"1b16de3a8f3c3d1158bb6c58b14f36211e42845c188957931f02fd8356abae19"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:14:14.945544Z","signature_b64":"Bc4aoHKI9+BjE7wwGipNH4iSR0a3QhbqDclwpVmgMuDFRph0AhZ1VZ6SN6wZX36H8X7IP038mHY8TaZl5B8NBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6c7beff787b9918b850bf82645624d9a73a47cb768897d4f7d9f8eea03c24548","last_reissued_at":"2026-07-05T10:14:14.944998Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:14:14.944998Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Preliminary Exploration with GPT-4o Voice Mode","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.SD","eess.AS"],"primary_cat":"cs.CL","authors_text":"Chen-An Li, Chien-yu Huang, Chih-Kai Yang, Hung-yi Lee, Wei-Chih Chen, Xuanjun Chen, Yu-Xiang Lin","submitted_at":"2025-02-14T06:34:08Z","abstract_excerpt":"With the rise of multimodal large language models, GPT-4o stands out as a pioneering model, driving us to evaluate its capabilities. This report assesses GPT-4o across various tasks to analyze its audio processing and reasoning abilities. We find that GPT-4o exhibits strong knowledge in audio, speech, and music understanding, performing well in tasks like intent classification, spoken command classification, semantic and grammatical reasoning., multilingual speech recognition, and singing analysis. It also shows greater robustness against hallucinations than other large audio-language models ("},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.09940","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.09940/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.09940","created_at":"2026-07-05T10:14:14.945065+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.09940v1","created_at":"2026-07-05T10:14:14.945065+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.09940","created_at":"2026-07-05T10:14:14.945065+00:00"},{"alias_kind":"pith_short_12","alias_value":"NR56754HXGIY","created_at":"2026-07-05T10:14:14.945065+00:00"},{"alias_kind":"pith_short_16","alias_value":"NR56754HXGIYXBIL","created_at":"2026-07-05T10:14:14.945065+00:00"},{"alias_kind":"pith_short_8","alias_value":"NR56754H","created_at":"2026-07-05T10:14:14.945065+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.06540","citing_title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","ref_index":38,"is_internal_anchor":true},{"citing_arxiv_id":"2606.21933","citing_title":"ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2510.00626","citing_title":"When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2512.23578","citing_title":"Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24401","citing_title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10065","citing_title":"ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models","ref_index":38,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NR56754HXGIYXBIL7ATEKYSNTJ","json":"https://pith.science/pith/NR56754HXGIYXBIL7ATEKYSNTJ.json","graph_json":"https://pith.science/api/pith-number/NR56754HXGIYXBIL7ATEKYSNTJ/graph.json","events_json":"https://pith.science/api/pith-number/NR56754HXGIYXBIL7ATEKYSNTJ/events.json","paper":"https://pith.science/paper/NR56754H"},"agent_actions":{"view_html":"https://pith.science/pith/NR56754HXGIYXBIL7ATEKYSNTJ","download_json":"https://pith.science/pith/NR56754HXGIYXBIL7ATEKYSNTJ.json","view_paper":"https://pith.science/paper/NR56754H","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.09940&json=true","fetch_graph":"https://pith.science/api/pith-number/NR56754HXGIYXBIL7ATEKYSNTJ/graph.json","fetch_events":"https://pith.science/api/pith-number/NR56754HXGIYXBIL7ATEKYSNTJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NR56754HXGIYXBIL7ATEKYSNTJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NR56754HXGIYXBIL7ATEKYSNTJ/action/storage_attestation","attest_author":"https://pith.science/pith/NR56754HXGIYXBIL7ATEKYSNTJ/action/author_attestation","sign_citation":"https://pith.science/pith/NR56754HXGIYXBIL7ATEKYSNTJ/action/citation_signature","submit_replication":"https://pith.science/pith/NR56754HXGIYXBIL7ATEKYSNTJ/action/replication_record"}},"created_at":"2026-07-05T10:14:14.945065+00:00","updated_at":"2026-07-05T10:14:14.945065+00:00"}