{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:KKUZF2B6QXTERIHXB5ZRKU5GDG","short_pith_number":"pith:KKUZF2B6","schema_version":"1.0","canonical_sha256":"52a992e83e85e648a0f70f731553a61982756481a22af673c497f33043579d3d","source":{"kind":"arxiv","id":"2204.00540","version":1},"attestation_state":"computed","paper":{"title":"End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","eess.AS"],"primary_cat":"cs.SD","authors_text":"Shinji Watanabe, Takashi Maekaku, Xuankai Chang, Yuya Fujita","submitted_at":"2022-04-01T16:02:31Z","abstract_excerpt":"This work presents our end-to-end (E2E) automatic speech recognition (ASR) model targetting at robust speech recognition, called Integraded speech Recognition with enhanced speech Input for Self-supervised learning representation (IRIS). Compared with conventional E2E ASR models, the proposed E2E model integrates two important modules including a speech enhancement (SE) module and a self-supervised learning representation (SSLR) module. The SE module enhances the noisy speech. Then the SSLR module extracts features from enhanced speech to be used for speech recognition (ASR). To train the prop"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2204.00540","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.SD","submitted_at":"2022-04-01T16:02:31Z","cross_cats_sorted":["cs.CL","eess.AS"],"title_canon_sha256":"efac34fccd06219bb958f05a93719e76bc960883284116a1c8a0f2c41d7dc73f","abstract_canon_sha256":"4e3efd48689d27f30fcf6f58c9eb11127b01ad767aa63e3561e440aeda904e79"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:10:48.483464Z","signature_b64":"C5BSmdVWdlK2UeWlcI4N+C12Ve1j0tkmUOHe1Y99tom88K4I9n6Ik98hYWUdfSAzgjMUE2lIGi1WHnsBmzyMBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"52a992e83e85e648a0f70f731553a61982756481a22af673c497f33043579d3d","last_reissued_at":"2026-07-05T04:10:48.482962Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:10:48.482962Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"End-to-End Integration of Speech Recognition, Speech Enhancement, and Self-Supervised Learning Representation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","eess.AS"],"primary_cat":"cs.SD","authors_text":"Shinji Watanabe, Takashi Maekaku, Xuankai Chang, Yuya Fujita","submitted_at":"2022-04-01T16:02:31Z","abstract_excerpt":"This work presents our end-to-end (E2E) automatic speech recognition (ASR) model targetting at robust speech recognition, called Integraded speech Recognition with enhanced speech Input for Self-supervised learning representation (IRIS). Compared with conventional E2E ASR models, the proposed E2E model integrates two important modules including a speech enhancement (SE) module and a self-supervised learning representation (SSLR) module. The SE module enhances the noisy speech. Then the SSLR module extracts features from enhanced speech to be used for speech recognition (ASR). To train the prop"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2204.00540","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2204.00540/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2204.00540","created_at":"2026-07-05T04:10:48.483017+00:00"},{"alias_kind":"arxiv_version","alias_value":"2204.00540v1","created_at":"2026-07-05T04:10:48.483017+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2204.00540","created_at":"2026-07-05T04:10:48.483017+00:00"},{"alias_kind":"pith_short_12","alias_value":"KKUZF2B6QXTE","created_at":"2026-07-05T04:10:48.483017+00:00"},{"alias_kind":"pith_short_16","alias_value":"KKUZF2B6QXTERIHX","created_at":"2026-07-05T04:10:48.483017+00:00"},{"alias_kind":"pith_short_8","alias_value":"KKUZF2B6","created_at":"2026-07-05T04:10:48.483017+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2506.17459","citing_title":"Breaking the Transcription Bottleneck: Fine-tuning ASR Models for Extremely Low-Resource Fieldwork Languages","ref_index":13,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/KKUZF2B6QXTERIHXB5ZRKU5GDG","json":"https://pith.science/pith/KKUZF2B6QXTERIHXB5ZRKU5GDG.json","graph_json":"https://pith.science/api/pith-number/KKUZF2B6QXTERIHXB5ZRKU5GDG/graph.json","events_json":"https://pith.science/api/pith-number/KKUZF2B6QXTERIHXB5ZRKU5GDG/events.json","paper":"https://pith.science/paper/KKUZF2B6"},"agent_actions":{"view_html":"https://pith.science/pith/KKUZF2B6QXTERIHXB5ZRKU5GDG","download_json":"https://pith.science/pith/KKUZF2B6QXTERIHXB5ZRKU5GDG.json","view_paper":"https://pith.science/paper/KKUZF2B6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2204.00540&json=true","fetch_graph":"https://pith.science/api/pith-number/KKUZF2B6QXTERIHXB5ZRKU5GDG/graph.json","fetch_events":"https://pith.science/api/pith-number/KKUZF2B6QXTERIHXB5ZRKU5GDG/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/KKUZF2B6QXTERIHXB5ZRKU5GDG/action/timestamp_anchor","attest_storage":"https://pith.science/pith/KKUZF2B6QXTERIHXB5ZRKU5GDG/action/storage_attestation","attest_author":"https://pith.science/pith/KKUZF2B6QXTERIHXB5ZRKU5GDG/action/author_attestation","sign_citation":"https://pith.science/pith/KKUZF2B6QXTERIHXB5ZRKU5GDG/action/citation_signature","submit_replication":"https://pith.science/pith/KKUZF2B6QXTERIHXB5ZRKU5GDG/action/replication_record"}},"created_at":"2026-07-05T04:10:48.483017+00:00","updated_at":"2026-07-05T04:10:48.483017+00:00"}