{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:UF5SOZFYBHUXS4NXIR2XDCJLP5","short_pith_number":"pith:UF5SOZFY","schema_version":"1.0","canonical_sha256":"a17b2764b809e97971b7447571892b7f64a2150126a31073ad591740f09c10e3","source":{"kind":"arxiv","id":"2409.11059","version":2},"attestation_state":"computed","paper":{"title":"OneEncoder: A Lightweight Framework for Progressive Alignment of Modalities","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Bilal Faye, Hanane Azzag, Mustapha Lebbah","submitted_at":"2024-09-17T10:38:46Z","abstract_excerpt":"Cross-modal alignment Learning integrates information from different modalities like text, image, audio and video to create unified models. This approach develops shared representations and learns correlations between modalities, enabling applications such as visual question answering and audiovisual content analysis. Current techniques rely on large modality-specific encoders, necessitating fine-tuning or training from scratch on vast aligned datasets (e.g., text-image, text-audio, image-audio). This approach has limitations: (i) it is very expensive due to the need for training large encoder"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.11059","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-09-17T10:38:46Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"ec23fbb02b0fe3fae699e26dae0c002b25d6eb8401a062c40da5c7830ac31602","abstract_canon_sha256":"caa09c13e6dae23431286ff86dda829ee0886c1630007facf3470b640e186bd5"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:08:30.051051Z","signature_b64":"k4PSPsIzAt9oA0fEUHgWV8roh3xYfIl7eS/Hm8mc7v7jmi3FKCH3dJg09zloEpIzMHDyoepeWhhh1PX5WURPAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a17b2764b809e97971b7447571892b7f64a2150126a31073ad591740f09c10e3","last_reissued_at":"2026-07-05T09:08:30.050627Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:08:30.050627Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"OneEncoder: A Lightweight Framework for Progressive Alignment of Modalities","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Bilal Faye, Hanane Azzag, Mustapha Lebbah","submitted_at":"2024-09-17T10:38:46Z","abstract_excerpt":"Cross-modal alignment Learning integrates information from different modalities like text, image, audio and video to create unified models. This approach develops shared representations and learns correlations between modalities, enabling applications such as visual question answering and audiovisual content analysis. Current techniques rely on large modality-specific encoders, necessitating fine-tuning or training from scratch on vast aligned datasets (e.g., text-image, text-audio, image-audio). This approach has limitations: (i) it is very expensive due to the need for training large encoder"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.11059","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.11059/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.11059","created_at":"2026-07-05T09:08:30.050694+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.11059v2","created_at":"2026-07-05T09:08:30.050694+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.11059","created_at":"2026-07-05T09:08:30.050694+00:00"},{"alias_kind":"pith_short_12","alias_value":"UF5SOZFYBHUX","created_at":"2026-07-05T09:08:30.050694+00:00"},{"alias_kind":"pith_short_16","alias_value":"UF5SOZFYBHUXS4NX","created_at":"2026-07-05T09:08:30.050694+00:00"},{"alias_kind":"pith_short_8","alias_value":"UF5SOZFY","created_at":"2026-07-05T09:08:30.050694+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.18257","citing_title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UF5SOZFYBHUXS4NXIR2XDCJLP5","json":"https://pith.science/pith/UF5SOZFYBHUXS4NXIR2XDCJLP5.json","graph_json":"https://pith.science/api/pith-number/UF5SOZFYBHUXS4NXIR2XDCJLP5/graph.json","events_json":"https://pith.science/api/pith-number/UF5SOZFYBHUXS4NXIR2XDCJLP5/events.json","paper":"https://pith.science/paper/UF5SOZFY"},"agent_actions":{"view_html":"https://pith.science/pith/UF5SOZFYBHUXS4NXIR2XDCJLP5","download_json":"https://pith.science/pith/UF5SOZFYBHUXS4NXIR2XDCJLP5.json","view_paper":"https://pith.science/paper/UF5SOZFY","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.11059&json=true","fetch_graph":"https://pith.science/api/pith-number/UF5SOZFYBHUXS4NXIR2XDCJLP5/graph.json","fetch_events":"https://pith.science/api/pith-number/UF5SOZFYBHUXS4NXIR2XDCJLP5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UF5SOZFYBHUXS4NXIR2XDCJLP5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UF5SOZFYBHUXS4NXIR2XDCJLP5/action/storage_attestation","attest_author":"https://pith.science/pith/UF5SOZFYBHUXS4NXIR2XDCJLP5/action/author_attestation","sign_citation":"https://pith.science/pith/UF5SOZFYBHUXS4NXIR2XDCJLP5/action/citation_signature","submit_replication":"https://pith.science/pith/UF5SOZFYBHUXS4NXIR2XDCJLP5/action/replication_record"}},"created_at":"2026-07-05T09:08:30.050694+00:00","updated_at":"2026-07-05T09:08:30.050694+00:00"}