{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:77KBCO4KMTWOETGKUTJDOORKVE","short_pith_number":"pith:77KBCO4K","schema_version":"1.0","canonical_sha256":"ffd4113b8a64ece24ccaa4d2373a2aa9025fd19251c7027fff65624862eb395f","source":{"kind":"arxiv","id":"2503.07591","version":2},"attestation_state":"computed","paper":{"title":"Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction Tuning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Bardia Safaei, Faizan Siddiqui, Jiacong Xu, Shao-Yuan Lo, Vishal M. Patel","submitted_at":"2025-03-10T17:55:11Z","abstract_excerpt":"Visual instruction tuning (VIT) for large vision-language models (LVLMs) requires training on expansive datasets of image-instruction pairs, which can be costly. Recent efforts in VIT data selection aim to select a small subset of high-quality image-instruction pairs, reducing VIT runtime while maintaining performance comparable to full-scale training. However, a major challenge often overlooked is that generating instructions from unlabeled images for VIT is highly expensive. Most existing VIT datasets rely heavily on human annotations or paid services like the GPT API, which limits users wit"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.07591","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-03-10T17:55:11Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"c8129fe1982628ac29c424eed9eac95662383e183ce8dd2d29d537da53a94e8a","abstract_canon_sha256":"85c3f086529a9a1bfa1c55672dc2468419fc3a91f15c15f7c98bdb5f2ad9b461"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:44:43.461512Z","signature_b64":"ZCm88sXpS8/pK4PD84xCGHq91TtYMjVQHK+eDYqaYkTrLXUP/ZbIrr7Zt0GTReAfirgtSZUVSoon/JaVjXE2BA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ffd4113b8a64ece24ccaa4d2373a2aa9025fd19251c7027fff65624862eb395f","last_reissued_at":"2026-07-05T10:44:43.460999Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:44:43.460999Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Filter Images First, Generate Instructions Later: Pre-Instruction Data Selection for Visual Instruction Tuning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Bardia Safaei, Faizan Siddiqui, Jiacong Xu, Shao-Yuan Lo, Vishal M. Patel","submitted_at":"2025-03-10T17:55:11Z","abstract_excerpt":"Visual instruction tuning (VIT) for large vision-language models (LVLMs) requires training on expansive datasets of image-instruction pairs, which can be costly. Recent efforts in VIT data selection aim to select a small subset of high-quality image-instruction pairs, reducing VIT runtime while maintaining performance comparable to full-scale training. However, a major challenge often overlooked is that generating instructions from unlabeled images for VIT is highly expensive. Most existing VIT datasets rely heavily on human annotations or paid services like the GPT API, which limits users wit"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.07591","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.07591/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.07591","created_at":"2026-07-05T10:44:43.461061+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.07591v2","created_at":"2026-07-05T10:44:43.461061+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.07591","created_at":"2026-07-05T10:44:43.461061+00:00"},{"alias_kind":"pith_short_12","alias_value":"77KBCO4KMTWO","created_at":"2026-07-05T10:44:43.461061+00:00"},{"alias_kind":"pith_short_16","alias_value":"77KBCO4KMTWOETGK","created_at":"2026-07-05T10:44:43.461061+00:00"},{"alias_kind":"pith_short_8","alias_value":"77KBCO4K","created_at":"2026-07-05T10:44:43.461061+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.19120","citing_title":"Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26761","citing_title":"Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning","ref_index":18,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/77KBCO4KMTWOETGKUTJDOORKVE","json":"https://pith.science/pith/77KBCO4KMTWOETGKUTJDOORKVE.json","graph_json":"https://pith.science/api/pith-number/77KBCO4KMTWOETGKUTJDOORKVE/graph.json","events_json":"https://pith.science/api/pith-number/77KBCO4KMTWOETGKUTJDOORKVE/events.json","paper":"https://pith.science/paper/77KBCO4K"},"agent_actions":{"view_html":"https://pith.science/pith/77KBCO4KMTWOETGKUTJDOORKVE","download_json":"https://pith.science/pith/77KBCO4KMTWOETGKUTJDOORKVE.json","view_paper":"https://pith.science/paper/77KBCO4K","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.07591&json=true","fetch_graph":"https://pith.science/api/pith-number/77KBCO4KMTWOETGKUTJDOORKVE/graph.json","fetch_events":"https://pith.science/api/pith-number/77KBCO4KMTWOETGKUTJDOORKVE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/77KBCO4KMTWOETGKUTJDOORKVE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/77KBCO4KMTWOETGKUTJDOORKVE/action/storage_attestation","attest_author":"https://pith.science/pith/77KBCO4KMTWOETGKUTJDOORKVE/action/author_attestation","sign_citation":"https://pith.science/pith/77KBCO4KMTWOETGKUTJDOORKVE/action/citation_signature","submit_replication":"https://pith.science/pith/77KBCO4KMTWOETGKUTJDOORKVE/action/replication_record"}},"created_at":"2026-07-05T10:44:43.461061+00:00","updated_at":"2026-07-05T10:44:43.461061+00:00"}