{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:WTXRXPW3C6EPZ6W5MMTHCXK3UA","short_pith_number":"pith:WTXRXPW3","schema_version":"1.0","canonical_sha256":"b4ef1bbedb1788fcfadd6326715d5ba0010b25035bc61ef8ae4a4f9217f9b7df","source":{"kind":"arxiv","id":"2410.10167","version":3},"attestation_state":"computed","paper":{"title":"X-Fi: A Modality-Invariant Foundation Model for Multimodal Human Sensing","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["eess.SP"],"primary_cat":"cs.CV","authors_text":"Jianfei Yang, Xinyan Chen","submitted_at":"2024-10-14T05:23:12Z","abstract_excerpt":"Human sensing, which employs various sensors and advanced deep learning technologies to accurately capture and interpret human body information, has significantly impacted fields like public security and robotics. However, current human sensing primarily depends on modalities such as cameras and LiDAR, each of which has its own strengths and limitations. Furthermore, existing multi-modal fusion solutions are typically designed for fixed modality combinations, requiring extensive retraining when modalities are added or removed for diverse scenarios. In this paper, we propose a modality-invarian"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.10167","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-10-14T05:23:12Z","cross_cats_sorted":["eess.SP"],"title_canon_sha256":"ff396282a84060745cab2a6fa9489f63f7718b712c2d4ab03cd47f4f12d74ad9","abstract_canon_sha256":"a58a07be79f40ed92071731e83658df7c269e93523fee825ae2155928c8e6609"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:15:20.414635Z","signature_b64":"tElUo9VeKxcnt6yWVX9mQGB6jsO4Reizpa/tf/NGB9wS/bWiz2Nf0GHmXRqG5otl1/OyHBcYzX7mKcJ2pnJJAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b4ef1bbedb1788fcfadd6326715d5ba0010b25035bc61ef8ae4a4f9217f9b7df","last_reissued_at":"2026-07-05T10:15:20.414123Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:15:20.414123Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"X-Fi: A Modality-Invariant Foundation Model for Multimodal Human Sensing","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["eess.SP"],"primary_cat":"cs.CV","authors_text":"Jianfei Yang, Xinyan Chen","submitted_at":"2024-10-14T05:23:12Z","abstract_excerpt":"Human sensing, which employs various sensors and advanced deep learning technologies to accurately capture and interpret human body information, has significantly impacted fields like public security and robotics. However, current human sensing primarily depends on modalities such as cameras and LiDAR, each of which has its own strengths and limitations. Furthermore, existing multi-modal fusion solutions are typically designed for fixed modality combinations, requiring extensive retraining when modalities are added or removed for diverse scenarios. In this paper, we propose a modality-invarian"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.10167","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.10167/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.10167","created_at":"2026-07-05T10:15:20.414187+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.10167v3","created_at":"2026-07-05T10:15:20.414187+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.10167","created_at":"2026-07-05T10:15:20.414187+00:00"},{"alias_kind":"pith_short_12","alias_value":"WTXRXPW3C6EP","created_at":"2026-07-05T10:15:20.414187+00:00"},{"alias_kind":"pith_short_16","alias_value":"WTXRXPW3C6EPZ6W5","created_at":"2026-07-05T10:15:20.414187+00:00"},{"alias_kind":"pith_short_8","alias_value":"WTXRXPW3","created_at":"2026-07-05T10:15:20.414187+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.30275","citing_title":"ActiveVital: Geometry-Aware Embodied Vital Signs Monitoring for Home Healthcare Robots","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2601.21670","citing_title":"Diverse via bounded Agreement: Geometric Regularization for Multimodal Fusion","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05584","citing_title":"Purify-then-Align: Towards Robust Human Sensing under Modality Missing with Knowledge Distillation from Noisy Multimodal Teacher","ref_index":4,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WTXRXPW3C6EPZ6W5MMTHCXK3UA","json":"https://pith.science/pith/WTXRXPW3C6EPZ6W5MMTHCXK3UA.json","graph_json":"https://pith.science/api/pith-number/WTXRXPW3C6EPZ6W5MMTHCXK3UA/graph.json","events_json":"https://pith.science/api/pith-number/WTXRXPW3C6EPZ6W5MMTHCXK3UA/events.json","paper":"https://pith.science/paper/WTXRXPW3"},"agent_actions":{"view_html":"https://pith.science/pith/WTXRXPW3C6EPZ6W5MMTHCXK3UA","download_json":"https://pith.science/pith/WTXRXPW3C6EPZ6W5MMTHCXK3UA.json","view_paper":"https://pith.science/paper/WTXRXPW3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.10167&json=true","fetch_graph":"https://pith.science/api/pith-number/WTXRXPW3C6EPZ6W5MMTHCXK3UA/graph.json","fetch_events":"https://pith.science/api/pith-number/WTXRXPW3C6EPZ6W5MMTHCXK3UA/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WTXRXPW3C6EPZ6W5MMTHCXK3UA/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WTXRXPW3C6EPZ6W5MMTHCXK3UA/action/storage_attestation","attest_author":"https://pith.science/pith/WTXRXPW3C6EPZ6W5MMTHCXK3UA/action/author_attestation","sign_citation":"https://pith.science/pith/WTXRXPW3C6EPZ6W5MMTHCXK3UA/action/citation_signature","submit_replication":"https://pith.science/pith/WTXRXPW3C6EPZ6W5MMTHCXK3UA/action/replication_record"}},"created_at":"2026-07-05T10:15:20.414187+00:00","updated_at":"2026-07-05T10:15:20.414187+00:00"}