{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:EYWGLTM7B6CM2PR7CMRZQQAE4R","short_pith_number":"pith:EYWGLTM7","schema_version":"1.0","canonical_sha256":"262c65cd9f0f84cd3e3f1323984004e453ffa09f10f0c2a395073545ba258534","source":{"kind":"arxiv","id":"2309.05396","version":3},"attestation_state":"computed","paper":{"title":"SlideSpeech: A Large-Scale Slide-Enriched Audio-Visual Corpus","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Fan Yu, Haoxu Wang, Ming Li, Shiliang Zhang, Xian Shi, Yuezhang Wang","submitted_at":"2023-09-11T11:56:44Z","abstract_excerpt":"Multi-Modal automatic speech recognition (ASR) techniques aim to leverage additional modalities to improve the performance of speech recognition systems. While existing approaches primarily focus on video or contextual information, the utilization of extra supplementary textual information has been overlooked. Recognizing the abundance of online conference videos with slides, which provide rich domain-specific information in the form of text and images, we release SlideSpeech, a large-scale audio-visual corpus enriched with slides. The corpus contains 1,705 videos, 1,000+ hours, with 473 hours"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2309.05396","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.SD","submitted_at":"2023-09-11T11:56:44Z","cross_cats_sorted":["eess.AS"],"title_canon_sha256":"396b42e1c34f67302e0ce0ff6feebce21dcc25056bc9fdafaa609db9a7aebd12","abstract_canon_sha256":"b2af3ed95bcda9c799d7952c8a00c4ee28b7d6eda4d2e8ca4c5f7fe54766f492"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:27:50.475987Z","signature_b64":"UBxiYS2GBBvvf/k++DCcPNWFmQdTO8hDlq2R7yzzKUrZqjV2EBa0YK+Y0GNsSwdO8rnr6QbQmRaprzQHKfhjAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"262c65cd9f0f84cd3e3f1323984004e453ffa09f10f0c2a395073545ba258534","last_reissued_at":"2026-07-05T07:27:50.475474Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:27:50.475474Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SlideSpeech: A Large-Scale Slide-Enriched Audio-Visual Corpus","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Fan Yu, Haoxu Wang, Ming Li, Shiliang Zhang, Xian Shi, Yuezhang Wang","submitted_at":"2023-09-11T11:56:44Z","abstract_excerpt":"Multi-Modal automatic speech recognition (ASR) techniques aim to leverage additional modalities to improve the performance of speech recognition systems. While existing approaches primarily focus on video or contextual information, the utilization of extra supplementary textual information has been overlooked. Recognizing the abundance of online conference videos with slides, which provide rich domain-specific information in the form of text and images, we release SlideSpeech, a large-scale audio-visual corpus enriched with slides. The corpus contains 1,705 videos, 1,000+ hours, with 473 hours"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2309.05396","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2309.05396/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2309.05396","created_at":"2026-07-05T07:27:50.475534+00:00"},{"alias_kind":"arxiv_version","alias_value":"2309.05396v3","created_at":"2026-07-05T07:27:50.475534+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2309.05396","created_at":"2026-07-05T07:27:50.475534+00:00"},{"alias_kind":"pith_short_12","alias_value":"EYWGLTM7B6CM","created_at":"2026-07-05T07:27:50.475534+00:00"},{"alias_kind":"pith_short_16","alias_value":"EYWGLTM7B6CM2PR7","created_at":"2026-07-05T07:27:50.475534+00:00"},{"alias_kind":"pith_short_8","alias_value":"EYWGLTM7","created_at":"2026-07-05T07:27:50.475534+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.08384","citing_title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","ref_index":32,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EYWGLTM7B6CM2PR7CMRZQQAE4R","json":"https://pith.science/pith/EYWGLTM7B6CM2PR7CMRZQQAE4R.json","graph_json":"https://pith.science/api/pith-number/EYWGLTM7B6CM2PR7CMRZQQAE4R/graph.json","events_json":"https://pith.science/api/pith-number/EYWGLTM7B6CM2PR7CMRZQQAE4R/events.json","paper":"https://pith.science/paper/EYWGLTM7"},"agent_actions":{"view_html":"https://pith.science/pith/EYWGLTM7B6CM2PR7CMRZQQAE4R","download_json":"https://pith.science/pith/EYWGLTM7B6CM2PR7CMRZQQAE4R.json","view_paper":"https://pith.science/paper/EYWGLTM7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2309.05396&json=true","fetch_graph":"https://pith.science/api/pith-number/EYWGLTM7B6CM2PR7CMRZQQAE4R/graph.json","fetch_events":"https://pith.science/api/pith-number/EYWGLTM7B6CM2PR7CMRZQQAE4R/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EYWGLTM7B6CM2PR7CMRZQQAE4R/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EYWGLTM7B6CM2PR7CMRZQQAE4R/action/storage_attestation","attest_author":"https://pith.science/pith/EYWGLTM7B6CM2PR7CMRZQQAE4R/action/author_attestation","sign_citation":"https://pith.science/pith/EYWGLTM7B6CM2PR7CMRZQQAE4R/action/citation_signature","submit_replication":"https://pith.science/pith/EYWGLTM7B6CM2PR7CMRZQQAE4R/action/replication_record"}},"created_at":"2026-07-05T07:27:50.475534+00:00","updated_at":"2026-07-05T07:27:50.475534+00:00"}