{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:JXN5XWZET3MY34XEDNWAIR6LZ5","short_pith_number":"pith:JXN5XWZE","schema_version":"1.0","canonical_sha256":"4ddbdbdb249ed98df2e41b6c0447cbcf63d9c253ef55dbeb0b3f22ba58e9919a","source":{"kind":"arxiv","id":"2106.03348","version":4},"attestation_state":"computed","paper":{"title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dacheng Tao, Jing Zhang, Qiming Zhang, Yufei Xu","submitted_at":"2021-06-07T05:31:06Z","abstract_excerpt":"Transformers have shown great potential in various computer vision tasks owing to their strong capability in modeling long-range dependency using the self-attention mechanism. Nevertheless, vision transformers treat an image as 1D sequence of visual tokens, lacking an intrinsic inductive bias (IB) in modeling local visual structures and dealing with scale variance. Alternatively, they require large-scale training data and longer training schedules to learn the IB implicitly. In this paper, we propose a novel Vision Transformer Advanced by Exploring intrinsic IB from convolutions, ie, ViTAE. Te"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2106.03348","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2021-06-07T05:31:06Z","cross_cats_sorted":[],"title_canon_sha256":"9d2335982254785e1695092c4bd6fbe57fddd532cd22dee728612c82ea01b329","abstract_canon_sha256":"ee9f184a1dded89e62a76871048b120f4d54c4905fae31a73986577e95aa458f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T03:43:41.828435Z","signature_b64":"wOG1fK01bH63s4Gks0UJv5qna5SEbCa9nOT7HHzh1vs964OM2D7z5+27ZiGe6zWrBa9yTYOY6VPjMf0IeYrTAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4ddbdbdb249ed98df2e41b6c0447cbcf63d9c253ef55dbeb0b3f22ba58e9919a","last_reissued_at":"2026-07-05T03:43:41.828013Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T03:43:41.828013Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ViTAE: Vision Transformer Advanced by Exploring Intrinsic Inductive Bias","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dacheng Tao, Jing Zhang, Qiming Zhang, Yufei Xu","submitted_at":"2021-06-07T05:31:06Z","abstract_excerpt":"Transformers have shown great potential in various computer vision tasks owing to their strong capability in modeling long-range dependency using the self-attention mechanism. Nevertheless, vision transformers treat an image as 1D sequence of visual tokens, lacking an intrinsic inductive bias (IB) in modeling local visual structures and dealing with scale variance. Alternatively, they require large-scale training data and longer training schedules to learn the IB implicitly. In this paper, we propose a novel Vision Transformer Advanced by Exploring intrinsic IB from convolutions, ie, ViTAE. Te"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2106.03348","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2106.03348/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2106.03348","created_at":"2026-07-05T03:43:41.828071+00:00"},{"alias_kind":"arxiv_version","alias_value":"2106.03348v4","created_at":"2026-07-05T03:43:41.828071+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2106.03348","created_at":"2026-07-05T03:43:41.828071+00:00"},{"alias_kind":"pith_short_12","alias_value":"JXN5XWZET3MY","created_at":"2026-07-05T03:43:41.828071+00:00"},{"alias_kind":"pith_short_16","alias_value":"JXN5XWZET3MY34XE","created_at":"2026-07-05T03:43:41.828071+00:00"},{"alias_kind":"pith_short_8","alias_value":"JXN5XWZE","created_at":"2026-07-05T03:43:41.828071+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2608.12084","citing_title":"NAE: Normalizing AutoEncoder","ref_index":73,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JXN5XWZET3MY34XEDNWAIR6LZ5","json":"https://pith.science/pith/JXN5XWZET3MY34XEDNWAIR6LZ5.json","graph_json":"https://pith.science/api/pith-number/JXN5XWZET3MY34XEDNWAIR6LZ5/graph.json","events_json":"https://pith.science/api/pith-number/JXN5XWZET3MY34XEDNWAIR6LZ5/events.json","paper":"https://pith.science/paper/JXN5XWZE"},"agent_actions":{"view_html":"https://pith.science/pith/JXN5XWZET3MY34XEDNWAIR6LZ5","download_json":"https://pith.science/pith/JXN5XWZET3MY34XEDNWAIR6LZ5.json","view_paper":"https://pith.science/paper/JXN5XWZE","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2106.03348&json=true","fetch_graph":"https://pith.science/api/pith-number/JXN5XWZET3MY34XEDNWAIR6LZ5/graph.json","fetch_events":"https://pith.science/api/pith-number/JXN5XWZET3MY34XEDNWAIR6LZ5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JXN5XWZET3MY34XEDNWAIR6LZ5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JXN5XWZET3MY34XEDNWAIR6LZ5/action/storage_attestation","attest_author":"https://pith.science/pith/JXN5XWZET3MY34XEDNWAIR6LZ5/action/author_attestation","sign_citation":"https://pith.science/pith/JXN5XWZET3MY34XEDNWAIR6LZ5/action/citation_signature","submit_replication":"https://pith.science/pith/JXN5XWZET3MY34XEDNWAIR6LZ5/action/replication_record"}},"created_at":"2026-07-05T03:43:41.828071+00:00","updated_at":"2026-07-05T03:43:41.828071+00:00"}