{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:6J3Y43KNMXQMRNMAHIQJRWSCYL","short_pith_number":"pith:6J3Y43KN","schema_version":"1.0","canonical_sha256":"f2778e6d4d65e0c8b5803a2098da42c2ed2757884fe1398ff58c60cb8541ed47","source":{"kind":"arxiv","id":"2404.02517","version":3},"attestation_state":"computed","paper":{"title":"HENet: Hybrid Encoding for End-to-end Multi-task 3D Perception from Multi-view Cameras","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ming-Hsuan Yang, Nan Dong, Shengxiang Qi, Xinhao Wang, Yongtao Wang, Yun Xing, Zhiwei Lin, Zhongyu Xia","submitted_at":"2024-04-03T07:10:18Z","abstract_excerpt":"Three-dimensional perception from multi-view cameras is a crucial component in autonomous driving systems, which involves multiple tasks like 3D object detection and bird's-eye-view (BEV) semantic segmentation. To improve perception precision, large image encoders, high-resolution images, and long-term temporal inputs have been adopted in recent 3D perception models, bringing remarkable performance gains. However, these techniques are often incompatible in training and inference scenarios due to computational resource constraints. Besides, modern autonomous driving systems prefer to adopt an e"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.02517","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-04-03T07:10:18Z","cross_cats_sorted":[],"title_canon_sha256":"26bdd2d2b7b0f9848e9c875c532c1b8d8440448fe69b93847e8da064d681f481","abstract_canon_sha256":"1c106142d835c2f03a10a1f931a6bc631367fae68c24d0fe40703c8d497396de"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:08:24.486612Z","signature_b64":"1tq+NhIG1UvmsqU+OwihsBqY/27bzH8DxfG9K21QWxpOFm3ph9sd8txfUX8rzIge16j5ghnPjV+87+F1NR+HBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f2778e6d4d65e0c8b5803a2098da42c2ed2757884fe1398ff58c60cb8541ed47","last_reissued_at":"2026-07-05T09:08:24.486075Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:08:24.486075Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"HENet: Hybrid Encoding for End-to-end Multi-task 3D Perception from Multi-view Cameras","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ming-Hsuan Yang, Nan Dong, Shengxiang Qi, Xinhao Wang, Yongtao Wang, Yun Xing, Zhiwei Lin, Zhongyu Xia","submitted_at":"2024-04-03T07:10:18Z","abstract_excerpt":"Three-dimensional perception from multi-view cameras is a crucial component in autonomous driving systems, which involves multiple tasks like 3D object detection and bird's-eye-view (BEV) semantic segmentation. To improve perception precision, large image encoders, high-resolution images, and long-term temporal inputs have been adopted in recent 3D perception models, bringing remarkable performance gains. However, these techniques are often incompatible in training and inference scenarios due to computational resource constraints. Besides, modern autonomous driving systems prefer to adopt an e"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.02517","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.02517/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.02517","created_at":"2026-07-05T09:08:24.486144+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.02517v3","created_at":"2026-07-05T09:08:24.486144+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.02517","created_at":"2026-07-05T09:08:24.486144+00:00"},{"alias_kind":"pith_short_12","alias_value":"6J3Y43KNMXQM","created_at":"2026-07-05T09:08:24.486144+00:00"},{"alias_kind":"pith_short_16","alias_value":"6J3Y43KNMXQMRNMA","created_at":"2026-07-05T09:08:24.486144+00:00"},{"alias_kind":"pith_short_8","alias_value":"6J3Y43KN","created_at":"2026-07-05T09:08:24.486144+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2604.02930","citing_title":"BEVPredFormer: Spatio-temporal Attention for BEV Instance Prediction in Autonomous Driving","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6J3Y43KNMXQMRNMAHIQJRWSCYL","json":"https://pith.science/pith/6J3Y43KNMXQMRNMAHIQJRWSCYL.json","graph_json":"https://pith.science/api/pith-number/6J3Y43KNMXQMRNMAHIQJRWSCYL/graph.json","events_json":"https://pith.science/api/pith-number/6J3Y43KNMXQMRNMAHIQJRWSCYL/events.json","paper":"https://pith.science/paper/6J3Y43KN"},"agent_actions":{"view_html":"https://pith.science/pith/6J3Y43KNMXQMRNMAHIQJRWSCYL","download_json":"https://pith.science/pith/6J3Y43KNMXQMRNMAHIQJRWSCYL.json","view_paper":"https://pith.science/paper/6J3Y43KN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.02517&json=true","fetch_graph":"https://pith.science/api/pith-number/6J3Y43KNMXQMRNMAHIQJRWSCYL/graph.json","fetch_events":"https://pith.science/api/pith-number/6J3Y43KNMXQMRNMAHIQJRWSCYL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6J3Y43KNMXQMRNMAHIQJRWSCYL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6J3Y43KNMXQMRNMAHIQJRWSCYL/action/storage_attestation","attest_author":"https://pith.science/pith/6J3Y43KNMXQMRNMAHIQJRWSCYL/action/author_attestation","sign_citation":"https://pith.science/pith/6J3Y43KNMXQMRNMAHIQJRWSCYL/action/citation_signature","submit_replication":"https://pith.science/pith/6J3Y43KNMXQMRNMAHIQJRWSCYL/action/replication_record"}},"created_at":"2026-07-05T09:08:24.486144+00:00","updated_at":"2026-07-05T09:08:24.486144+00:00"}