{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:YL5FFR52KQHA7Z2LY7W2UMM6UH","short_pith_number":"pith:YL5FFR52","schema_version":"1.0","canonical_sha256":"c2fa52c7ba540e0fe74bc7edaa319ea1d60077dbc79a5c84effed31c0aaf7e2d","source":{"kind":"arxiv","id":"2407.12735","version":4},"attestation_state":"computed","paper":{"title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Weidi Xie, Yibin Yan","submitted_at":"2024-07-17T16:55:42Z","abstract_excerpt":"Knowledge-based Visual Question Answering (KVQA) tasks require answering questions about images using extensive background knowledge. Despite significant advancements, generative models often struggle with these tasks due to the limited integration of external knowledge. In this paper, we introduce EchoSight, a novel multimodal Retrieval-Augmented Generation (RAG) framework that enables large language models (LLMs) to answer visual questions requiring fine-grained encyclopedic knowledge. To strive for high-performing retrieval, EchoSight first searches wiki articles by using visual-only inform"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.12735","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-07-17T16:55:42Z","cross_cats_sorted":[],"title_canon_sha256":"6ac67e5ef8846f5c1abbb7c558cfd1b8c3b8db089024b0493c1883887977cf9a","abstract_canon_sha256":"f714754acf693b6654cad64a33a7690062eae9df8d1db6a15d77a08283f16b38"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:42:28.069509Z","signature_b64":"V9M1/0sZ47g6k/34y9hCGUGp6h3lEQjM4WidnnDgUrqVVVqTVQ89BoKIFRbK8UFhRxDqlGikEE1KbJyeoMtIBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c2fa52c7ba540e0fe74bc7edaa319ea1d60077dbc79a5c84effed31c0aaf7e2d","last_reissued_at":"2026-07-05T09:42:28.069036Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:42:28.069036Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Weidi Xie, Yibin Yan","submitted_at":"2024-07-17T16:55:42Z","abstract_excerpt":"Knowledge-based Visual Question Answering (KVQA) tasks require answering questions about images using extensive background knowledge. Despite significant advancements, generative models often struggle with these tasks due to the limited integration of external knowledge. In this paper, we introduce EchoSight, a novel multimodal Retrieval-Augmented Generation (RAG) framework that enables large language models (LLMs) to answer visual questions requiring fine-grained encyclopedic knowledge. To strive for high-performing retrieval, EchoSight first searches wiki articles by using visual-only inform"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.12735","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.12735/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.12735","created_at":"2026-07-05T09:42:28.069093+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.12735v4","created_at":"2026-07-05T09:42:28.069093+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.12735","created_at":"2026-07-05T09:42:28.069093+00:00"},{"alias_kind":"pith_short_12","alias_value":"YL5FFR52KQHA","created_at":"2026-07-05T09:42:28.069093+00:00"},{"alias_kind":"pith_short_16","alias_value":"YL5FFR52KQHA7Z2L","created_at":"2026-07-05T09:42:28.069093+00:00"},{"alias_kind":"pith_short_8","alias_value":"YL5FFR52","created_at":"2026-07-05T09:42:28.069093+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23881","citing_title":"Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17888","citing_title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21479","citing_title":"WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata","ref_index":100,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09552","citing_title":"MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2603.09921","citing_title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","ref_index":43,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YL5FFR52KQHA7Z2LY7W2UMM6UH","json":"https://pith.science/pith/YL5FFR52KQHA7Z2LY7W2UMM6UH.json","graph_json":"https://pith.science/api/pith-number/YL5FFR52KQHA7Z2LY7W2UMM6UH/graph.json","events_json":"https://pith.science/api/pith-number/YL5FFR52KQHA7Z2LY7W2UMM6UH/events.json","paper":"https://pith.science/paper/YL5FFR52"},"agent_actions":{"view_html":"https://pith.science/pith/YL5FFR52KQHA7Z2LY7W2UMM6UH","download_json":"https://pith.science/pith/YL5FFR52KQHA7Z2LY7W2UMM6UH.json","view_paper":"https://pith.science/paper/YL5FFR52","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.12735&json=true","fetch_graph":"https://pith.science/api/pith-number/YL5FFR52KQHA7Z2LY7W2UMM6UH/graph.json","fetch_events":"https://pith.science/api/pith-number/YL5FFR52KQHA7Z2LY7W2UMM6UH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YL5FFR52KQHA7Z2LY7W2UMM6UH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YL5FFR52KQHA7Z2LY7W2UMM6UH/action/storage_attestation","attest_author":"https://pith.science/pith/YL5FFR52KQHA7Z2LY7W2UMM6UH/action/author_attestation","sign_citation":"https://pith.science/pith/YL5FFR52KQHA7Z2LY7W2UMM6UH/action/citation_signature","submit_replication":"https://pith.science/pith/YL5FFR52KQHA7Z2LY7W2UMM6UH/action/replication_record"}},"created_at":"2026-07-05T09:42:28.069093+00:00","updated_at":"2026-07-05T09:42:28.069093+00:00"}