{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:NRF4ABTBBC55BZZXC4IAHFC73Y","short_pith_number":"pith:NRF4ABTB","schema_version":"1.0","canonical_sha256":"6c4bc0066108bbd0e737171003945fde1d30d573e89f6d17edd9826cf4ab0166","source":{"kind":"arxiv","id":"2308.13437","version":2},"attestation_state":"computed","paper":{"title":"Position-Enhanced Visual Instruction Tuning for Multimodal Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chi Chen, Fuwen Luo, Maosong Sun, Peng Li, Ruoyu Qin, Xiaoyue Mi, Yang Liu","submitted_at":"2023-08-25T15:33:47Z","abstract_excerpt":"Recently, Multimodal Large Language Models (MLLMs) that enable Large Language Models (LLMs) to interpret images through visual instruction tuning have achieved significant success. However, existing visual instruction tuning methods only utilize image-language instruction data to align the language and image modalities, lacking a more fine-grained cross-modal alignment. In this paper, we propose Position-enhanced Visual Instruction Tuning (PVIT), which extends the functionality of MLLMs by integrating an additional region-level vision encoder. This integration promotes a more detailed comprehe"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2308.13437","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2023-08-25T15:33:47Z","cross_cats_sorted":[],"title_canon_sha256":"bf31a8d5b7cd0be56ca8daad659da612c4d0162761e2ee7fced87855642a7066","abstract_canon_sha256":"ba96875153fc85ed5c71371fc2a25e41e8ccce93aae72a0a6672b02e9e902e5f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:50:41.846150Z","signature_b64":"iz7qTZ6vYj+KmkQ3jF9KNf1mX9iQs9+PggHkWRs0NNpxWErTEXJqG55YXj/FLmrsoKeLK5zQGvT9u+TmpMo6Bw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6c4bc0066108bbd0e737171003945fde1d30d573e89f6d17edd9826cf4ab0166","last_reissued_at":"2026-07-05T06:50:41.845743Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:50:41.845743Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Position-Enhanced Visual Instruction Tuning for Multimodal Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chi Chen, Fuwen Luo, Maosong Sun, Peng Li, Ruoyu Qin, Xiaoyue Mi, Yang Liu","submitted_at":"2023-08-25T15:33:47Z","abstract_excerpt":"Recently, Multimodal Large Language Models (MLLMs) that enable Large Language Models (LLMs) to interpret images through visual instruction tuning have achieved significant success. However, existing visual instruction tuning methods only utilize image-language instruction data to align the language and image modalities, lacking a more fine-grained cross-modal alignment. In this paper, we propose Position-enhanced Visual Instruction Tuning (PVIT), which extends the functionality of MLLMs by integrating an additional region-level vision encoder. This integration promotes a more detailed comprehe"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2308.13437","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2308.13437/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2308.13437","created_at":"2026-07-05T06:50:41.845802+00:00"},{"alias_kind":"arxiv_version","alias_value":"2308.13437v2","created_at":"2026-07-05T06:50:41.845802+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2308.13437","created_at":"2026-07-05T06:50:41.845802+00:00"},{"alias_kind":"pith_short_12","alias_value":"NRF4ABTBBC55","created_at":"2026-07-05T06:50:41.845802+00:00"},{"alias_kind":"pith_short_16","alias_value":"NRF4ABTBBC55BZZX","created_at":"2026-07-05T06:50:41.845802+00:00"},{"alias_kind":"pith_short_8","alias_value":"NRF4ABTB","created_at":"2026-07-05T06:50:41.845802+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.18018","citing_title":"See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2512.10554","citing_title":"Grounding Everything in Tokens for Multimodal Large Language Models","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2402.00253","citing_title":"A Survey on Hallucination in Large Vision-Language Models","ref_index":3,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NRF4ABTBBC55BZZXC4IAHFC73Y","json":"https://pith.science/pith/NRF4ABTBBC55BZZXC4IAHFC73Y.json","graph_json":"https://pith.science/api/pith-number/NRF4ABTBBC55BZZXC4IAHFC73Y/graph.json","events_json":"https://pith.science/api/pith-number/NRF4ABTBBC55BZZXC4IAHFC73Y/events.json","paper":"https://pith.science/paper/NRF4ABTB"},"agent_actions":{"view_html":"https://pith.science/pith/NRF4ABTBBC55BZZXC4IAHFC73Y","download_json":"https://pith.science/pith/NRF4ABTBBC55BZZXC4IAHFC73Y.json","view_paper":"https://pith.science/paper/NRF4ABTB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2308.13437&json=true","fetch_graph":"https://pith.science/api/pith-number/NRF4ABTBBC55BZZXC4IAHFC73Y/graph.json","fetch_events":"https://pith.science/api/pith-number/NRF4ABTBBC55BZZXC4IAHFC73Y/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NRF4ABTBBC55BZZXC4IAHFC73Y/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NRF4ABTBBC55BZZXC4IAHFC73Y/action/storage_attestation","attest_author":"https://pith.science/pith/NRF4ABTBBC55BZZXC4IAHFC73Y/action/author_attestation","sign_citation":"https://pith.science/pith/NRF4ABTBBC55BZZXC4IAHFC73Y/action/citation_signature","submit_replication":"https://pith.science/pith/NRF4ABTBBC55BZZXC4IAHFC73Y/action/replication_record"}},"created_at":"2026-07-05T06:50:41.845802+00:00","updated_at":"2026-07-05T06:50:41.845802+00:00"}