{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:EWD36ORECJRQGGVEOU6CGIYDJG","short_pith_number":"pith:EWD36ORE","schema_version":"1.0","canonical_sha256":"2587bf3a241263031aa4753c23230349abf25904986c64b08b340d8db3ef8c6d","source":{"kind":"arxiv","id":"2104.02724","version":2},"attestation_state":"computed","paper":{"title":"Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.SD"],"primary_cat":"eess.AS","authors_text":"Jumon Nozaki, Tatsuya Komatsu","submitted_at":"2021-04-06T18:00:03Z","abstract_excerpt":"This paper proposes a method to relax the conditional independence assumption of connectionist temporal classification (CTC)-based automatic speech recognition (ASR) models. We train a CTC-based ASR model with auxiliary CTC losses in intermediate layers in addition to the original CTC loss in the last layer. During both training and inference, each generated prediction in the intermediate layers is summed to the input of the next layer to condition the prediction of the last layer on those intermediate predictions. Our method is easy to implement and retains the merits of CTC-based ASR: a simp"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2104.02724","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"eess.AS","submitted_at":"2021-04-06T18:00:03Z","cross_cats_sorted":["cs.CL","cs.SD"],"title_canon_sha256":"5de620bf8de972197bdfaca2e2b13d01ce27a335c98dcb593ab36769680516b7","abstract_canon_sha256":"8d9ee9398f149d8d8eb0091f4eec0f486cea3e822b96c05021b14712d06e2dda"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T03:20:54.948531Z","signature_b64":"ItD1Jwm2foW5BIn2IKzemhuMgeucVPECVhcA+fEYOnl7I1CTQZvaVw+XPMP802uetX0PollyGvmPGKIzg9ZEDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2587bf3a241263031aa4753c23230349abf25904986c64b08b340d8db3ef8c6d","last_reissued_at":"2026-07-05T03:20:54.948027Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T03:20:54.948027Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Relaxing the Conditional Independence Assumption of CTC-based ASR by Conditioning on Intermediate Predictions","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.SD"],"primary_cat":"eess.AS","authors_text":"Jumon Nozaki, Tatsuya Komatsu","submitted_at":"2021-04-06T18:00:03Z","abstract_excerpt":"This paper proposes a method to relax the conditional independence assumption of connectionist temporal classification (CTC)-based automatic speech recognition (ASR) models. We train a CTC-based ASR model with auxiliary CTC losses in intermediate layers in addition to the original CTC loss in the last layer. During both training and inference, each generated prediction in the intermediate layers is summed to the input of the next layer to condition the prediction of the last layer on those intermediate predictions. Our method is easy to implement and retains the merits of CTC-based ASR: a simp"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2104.02724","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2104.02724/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2104.02724","created_at":"2026-07-05T03:20:54.948084+00:00"},{"alias_kind":"arxiv_version","alias_value":"2104.02724v2","created_at":"2026-07-05T03:20:54.948084+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2104.02724","created_at":"2026-07-05T03:20:54.948084+00:00"},{"alias_kind":"pith_short_12","alias_value":"EWD36ORECJRQ","created_at":"2026-07-05T03:20:54.948084+00:00"},{"alias_kind":"pith_short_16","alias_value":"EWD36ORECJRQGGVE","created_at":"2026-07-05T03:20:54.948084+00:00"},{"alias_kind":"pith_short_8","alias_value":"EWD36ORE","created_at":"2026-07-05T03:20:54.948084+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.06065","citing_title":"Multi-task Learning is Not Enough: Representational Entanglement in Dual-output Second Language Speech Recognition","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04678","citing_title":"Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers","ref_index":23,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EWD36ORECJRQGGVEOU6CGIYDJG","json":"https://pith.science/pith/EWD36ORECJRQGGVEOU6CGIYDJG.json","graph_json":"https://pith.science/api/pith-number/EWD36ORECJRQGGVEOU6CGIYDJG/graph.json","events_json":"https://pith.science/api/pith-number/EWD36ORECJRQGGVEOU6CGIYDJG/events.json","paper":"https://pith.science/paper/EWD36ORE"},"agent_actions":{"view_html":"https://pith.science/pith/EWD36ORECJRQGGVEOU6CGIYDJG","download_json":"https://pith.science/pith/EWD36ORECJRQGGVEOU6CGIYDJG.json","view_paper":"https://pith.science/paper/EWD36ORE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2104.02724&json=true","fetch_graph":"https://pith.science/api/pith-number/EWD36ORECJRQGGVEOU6CGIYDJG/graph.json","fetch_events":"https://pith.science/api/pith-number/EWD36ORECJRQGGVEOU6CGIYDJG/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EWD36ORECJRQGGVEOU6CGIYDJG/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EWD36ORECJRQGGVEOU6CGIYDJG/action/storage_attestation","attest_author":"https://pith.science/pith/EWD36ORECJRQGGVEOU6CGIYDJG/action/author_attestation","sign_citation":"https://pith.science/pith/EWD36ORECJRQGGVEOU6CGIYDJG/action/citation_signature","submit_replication":"https://pith.science/pith/EWD36ORECJRQGGVEOU6CGIYDJG/action/replication_record"}},"created_at":"2026-07-05T03:20:54.948084+00:00","updated_at":"2026-07-05T03:20:54.948084+00:00"}