{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:NYNUATQBNTEJ3BFZ2L7F7AONLX","short_pith_number":"pith:NYNUATQB","schema_version":"1.0","canonical_sha256":"6e1b404e016cc89d84b9d2fe5f81cd5dda25a56e17c1dfc96b4de554a845acbe","source":{"kind":"arxiv","id":"2412.01720","version":1},"attestation_state":"computed","paper":{"title":"LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jiangchao Yao, Jiayin Cai, Pingan Chen, Weidi Xie, Xiaolong Jiang, Yanfeng Wang, Yao Hu, Yikun Liu","submitted_at":"2024-12-02T17:10:16Z","abstract_excerpt":"With the rapid advancement of multimodal information retrieval, increasingly complex retrieval tasks have emerged. Existing methods predominately rely on task-specific fine-tuning of vision-language models, often those trained with image-text contrastive learning. In this paper, we explore the possibility of re-purposing generative Large Multimodal Models (LMMs) for retrieval. This approach enables unifying all retrieval tasks under the same formulation and, more importantly, allows for extrapolation towards unseen retrieval tasks without additional training. Our contributions can be summarise"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.01720","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-12-02T17:10:16Z","cross_cats_sorted":[],"title_canon_sha256":"7012e022c3f1629311d2f6847895e6108ef01de5193765301208509c0d0cc8f1","abstract_canon_sha256":"9e81fdf8d7dde4b824dff0260c38f0936b4ed4e28b2cb2d147ef34af289757c6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:43:18.092556Z","signature_b64":"g4dSotXhvCUxdpeMUGwL61whJsBZiMLJb1d2mu+P1m9na1v2411JLWChN7/LHAw/U8X0R2+mw8vbndlP2KTiDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6e1b404e016cc89d84b9d2fe5f81cd5dda25a56e17c1dfc96b4de554a845acbe","last_reissued_at":"2026-07-05T09:43:18.092058Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:43:18.092058Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Jiangchao Yao, Jiayin Cai, Pingan Chen, Weidi Xie, Xiaolong Jiang, Yanfeng Wang, Yao Hu, Yikun Liu","submitted_at":"2024-12-02T17:10:16Z","abstract_excerpt":"With the rapid advancement of multimodal information retrieval, increasingly complex retrieval tasks have emerged. Existing methods predominately rely on task-specific fine-tuning of vision-language models, often those trained with image-text contrastive learning. In this paper, we explore the possibility of re-purposing generative Large Multimodal Models (LMMs) for retrieval. This approach enables unifying all retrieval tasks under the same formulation and, more importantly, allows for extrapolation towards unseen retrieval tasks without additional training. Our contributions can be summarise"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.01720","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.01720/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.01720","created_at":"2026-07-05T09:43:18.092117+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.01720v1","created_at":"2026-07-05T09:43:18.092117+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.01720","created_at":"2026-07-05T09:43:18.092117+00:00"},{"alias_kind":"pith_short_12","alias_value":"NYNUATQBNTEJ","created_at":"2026-07-05T09:43:18.092117+00:00"},{"alias_kind":"pith_short_16","alias_value":"NYNUATQBNTEJ3BFZ","created_at":"2026-07-05T09:43:18.092117+00:00"},{"alias_kind":"pith_short_8","alias_value":"NYNUATQB","created_at":"2026-07-05T09:43:18.092117+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.24938","citing_title":"Your Embedding Model is SMARTer Than You Think","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2509.00798","citing_title":"Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2507.04590","citing_title":"VLM2Vec-V2: Advancing Multimodal Embedding for Videos, Images, and Visual Documents","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11095","citing_title":"Bottleneck Tokens for Unified Multimodal Retrieval","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NYNUATQBNTEJ3BFZ2L7F7AONLX","json":"https://pith.science/pith/NYNUATQBNTEJ3BFZ2L7F7AONLX.json","graph_json":"https://pith.science/api/pith-number/NYNUATQBNTEJ3BFZ2L7F7AONLX/graph.json","events_json":"https://pith.science/api/pith-number/NYNUATQBNTEJ3BFZ2L7F7AONLX/events.json","paper":"https://pith.science/paper/NYNUATQB"},"agent_actions":{"view_html":"https://pith.science/pith/NYNUATQBNTEJ3BFZ2L7F7AONLX","download_json":"https://pith.science/pith/NYNUATQBNTEJ3BFZ2L7F7AONLX.json","view_paper":"https://pith.science/paper/NYNUATQB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.01720&json=true","fetch_graph":"https://pith.science/api/pith-number/NYNUATQBNTEJ3BFZ2L7F7AONLX/graph.json","fetch_events":"https://pith.science/api/pith-number/NYNUATQBNTEJ3BFZ2L7F7AONLX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NYNUATQBNTEJ3BFZ2L7F7AONLX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NYNUATQBNTEJ3BFZ2L7F7AONLX/action/storage_attestation","attest_author":"https://pith.science/pith/NYNUATQBNTEJ3BFZ2L7F7AONLX/action/author_attestation","sign_citation":"https://pith.science/pith/NYNUATQBNTEJ3BFZ2L7F7AONLX/action/citation_signature","submit_replication":"https://pith.science/pith/NYNUATQBNTEJ3BFZ2L7F7AONLX/action/replication_record"}},"created_at":"2026-07-05T09:43:18.092117+00:00","updated_at":"2026-07-05T09:43:18.092117+00:00"}