{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ET5XDL4HYCF7MH5BRI5PCFEWX6","short_pith_number":"pith:ET5XDL4H","schema_version":"1.0","canonical_sha256":"24fb71af87c08bf61fa18a3af11496bfbfe5b84416ee3822925781623df659f5","source":{"kind":"arxiv","id":"2504.02971","version":2},"attestation_state":"computed","paper":{"title":"QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Binh M. Le, Bryan Wang, Hongdong Li, Jinmiao Fu, Moyan Li, Sameera Ramasinghe, Shaoyuan Xu, Yanhui Guo, Zhishen Huang","submitted_at":"2025-04-03T18:47:16Z","abstract_excerpt":"In Visual Document Understanding (VDU) tasks, fine-tuning a pre-trained Vision-Language Model (VLM) with new datasets often falls short in optimizing the vision encoder to identify query-specific regions in text-rich document images. Existing methods that directly inject queries into model layers by modifying the network architecture often struggle to adapt to new datasets with limited annotations. To address this, we introduce QID, a novel, streamlined, architecture-preserving approach that integrates query embeddings into the vision encoder, leading to notable performance gains, particularly"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.02971","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-04-03T18:47:16Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"c29fc14b96369441163322f27d59629920454795c846ba733440f6b22ce898df","abstract_canon_sha256":"21e5d6491626b7171c7ba364c28d5b287b860595106f2dcc433a6fceaf69322d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:45:39.427299Z","signature_b64":"w3vnHAX4hZxepegTVCzslfd2n0cnVBL3AhiodFTngqfA1JGCbpWftaGCBGc+GO9xmnaEhf/hT3jrBKxEIWHICg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"24fb71af87c08bf61fa18a3af11496bfbfe5b84416ee3822925781623df659f5","last_reissued_at":"2026-07-05T10:45:39.426798Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:45:39.426798Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"QID: Efficient Query-Informed ViTs in Data-Scarce Regimes for OCR-free Visual Document Understanding","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Binh M. Le, Bryan Wang, Hongdong Li, Jinmiao Fu, Moyan Li, Sameera Ramasinghe, Shaoyuan Xu, Yanhui Guo, Zhishen Huang","submitted_at":"2025-04-03T18:47:16Z","abstract_excerpt":"In Visual Document Understanding (VDU) tasks, fine-tuning a pre-trained Vision-Language Model (VLM) with new datasets often falls short in optimizing the vision encoder to identify query-specific regions in text-rich document images. Existing methods that directly inject queries into model layers by modifying the network architecture often struggle to adapt to new datasets with limited annotations. To address this, we introduce QID, a novel, streamlined, architecture-preserving approach that integrates query embeddings into the vision encoder, leading to notable performance gains, particularly"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.02971","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.02971/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.02971","created_at":"2026-07-05T10:45:39.426860+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.02971v2","created_at":"2026-07-05T10:45:39.426860+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.02971","created_at":"2026-07-05T10:45:39.426860+00:00"},{"alias_kind":"pith_short_12","alias_value":"ET5XDL4HYCF7","created_at":"2026-07-05T10:45:39.426860+00:00"},{"alias_kind":"pith_short_16","alias_value":"ET5XDL4HYCF7MH5B","created_at":"2026-07-05T10:45:39.426860+00:00"},{"alias_kind":"pith_short_8","alias_value":"ET5XDL4H","created_at":"2026-07-05T10:45:39.426860+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ET5XDL4HYCF7MH5BRI5PCFEWX6","json":"https://pith.science/pith/ET5XDL4HYCF7MH5BRI5PCFEWX6.json","graph_json":"https://pith.science/api/pith-number/ET5XDL4HYCF7MH5BRI5PCFEWX6/graph.json","events_json":"https://pith.science/api/pith-number/ET5XDL4HYCF7MH5BRI5PCFEWX6/events.json","paper":"https://pith.science/paper/ET5XDL4H"},"agent_actions":{"view_html":"https://pith.science/pith/ET5XDL4HYCF7MH5BRI5PCFEWX6","download_json":"https://pith.science/pith/ET5XDL4HYCF7MH5BRI5PCFEWX6.json","view_paper":"https://pith.science/paper/ET5XDL4H","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.02971&json=true","fetch_graph":"https://pith.science/api/pith-number/ET5XDL4HYCF7MH5BRI5PCFEWX6/graph.json","fetch_events":"https://pith.science/api/pith-number/ET5XDL4HYCF7MH5BRI5PCFEWX6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ET5XDL4HYCF7MH5BRI5PCFEWX6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ET5XDL4HYCF7MH5BRI5PCFEWX6/action/storage_attestation","attest_author":"https://pith.science/pith/ET5XDL4HYCF7MH5BRI5PCFEWX6/action/author_attestation","sign_citation":"https://pith.science/pith/ET5XDL4HYCF7MH5BRI5PCFEWX6/action/citation_signature","submit_replication":"https://pith.science/pith/ET5XDL4HYCF7MH5BRI5PCFEWX6/action/replication_record"}},"created_at":"2026-07-05T10:45:39.426860+00:00","updated_at":"2026-07-05T10:45:39.426860+00:00"}