{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:VD4GJCMK2MIPZ6TVHPQBDGUEC3","short_pith_number":"pith:VD4GJCMK","schema_version":"1.0","canonical_sha256":"a8f864898ad310fcfa753be0119a8416e4a02d2f8593d15ecd35598a918693c0","source":{"kind":"arxiv","id":"2406.06462","version":4},"attestation_state":"computed","paper":{"title":"VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Bang Liu, Ge Zhang, Jie Fu, Lu Li, Perouz Taslakian, Sai Rajeswar, Suyuchen Wang, Tianyu Zhang, Yoshua Bengio","submitted_at":"2024-06-10T16:58:48Z","abstract_excerpt":"We introduce Visual Caption Restoration (VCR), a novel vision-language task that challenges models to accurately restore partially obscured texts using pixel-level hints within images. This task stems from the observation that text embedded in images is intrinsically different from common visual elements and natural language due to the need to align the modalities of vision, text, and text embedded in images. While numerous works have integrated text embedded in images into visual question-answering tasks, approaches to these tasks generally rely on optical character recognition or masked lang"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.06462","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2024-06-10T16:58:48Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"51c07b2c6d21fcf49c161eed6f83158f35f31329f3b75e8125ec37673fbad7fd","abstract_canon_sha256":"76a0789529c90a181627eb585d2cf6355b08859204daf2c82394cd0e4d32b981"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:50:42.431065Z","signature_b64":"1wI6Zm81+B9rLGUi3WbSliLjoZJX5xgA4hwdEWBjJC3Us48EdfZvmxbCgA2nMU8I5ekveAf9EWEd456cDkhyCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a8f864898ad310fcfa753be0119a8416e4a02d2f8593d15ecd35598a918693c0","last_reissued_at":"2026-07-05T10:50:42.430564Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:50:42.430564Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Bang Liu, Ge Zhang, Jie Fu, Lu Li, Perouz Taslakian, Sai Rajeswar, Suyuchen Wang, Tianyu Zhang, Yoshua Bengio","submitted_at":"2024-06-10T16:58:48Z","abstract_excerpt":"We introduce Visual Caption Restoration (VCR), a novel vision-language task that challenges models to accurately restore partially obscured texts using pixel-level hints within images. This task stems from the observation that text embedded in images is intrinsically different from common visual elements and natural language due to the need to align the modalities of vision, text, and text embedded in images. While numerous works have integrated text embedded in images into visual question-answering tasks, approaches to these tasks generally rely on optical character recognition or masked lang"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.06462","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.06462/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.06462","created_at":"2026-07-05T10:50:42.430620+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.06462v4","created_at":"2026-07-05T10:50:42.430620+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.06462","created_at":"2026-07-05T10:50:42.430620+00:00"},{"alias_kind":"pith_short_12","alias_value":"VD4GJCMK2MIP","created_at":"2026-07-05T10:50:42.430620+00:00"},{"alias_kind":"pith_short_16","alias_value":"VD4GJCMK2MIPZ6TV","created_at":"2026-07-05T10:50:42.430620+00:00"},{"alias_kind":"pith_short_8","alias_value":"VD4GJCMK","created_at":"2026-07-05T10:50:42.430620+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.17030","citing_title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2502.04326","citing_title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","ref_index":84,"is_internal_anchor":false},{"citing_arxiv_id":"2408.16500","citing_title":"CogVLM2: Visual Language Models for Image and Video Understanding","ref_index":92,"is_internal_anchor":false},{"citing_arxiv_id":"2504.10479","citing_title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","ref_index":149,"is_internal_anchor":false},{"citing_arxiv_id":"2508.18265","citing_title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","ref_index":177,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VD4GJCMK2MIPZ6TVHPQBDGUEC3","json":"https://pith.science/pith/VD4GJCMK2MIPZ6TVHPQBDGUEC3.json","graph_json":"https://pith.science/api/pith-number/VD4GJCMK2MIPZ6TVHPQBDGUEC3/graph.json","events_json":"https://pith.science/api/pith-number/VD4GJCMK2MIPZ6TVHPQBDGUEC3/events.json","paper":"https://pith.science/paper/VD4GJCMK"},"agent_actions":{"view_html":"https://pith.science/pith/VD4GJCMK2MIPZ6TVHPQBDGUEC3","download_json":"https://pith.science/pith/VD4GJCMK2MIPZ6TVHPQBDGUEC3.json","view_paper":"https://pith.science/paper/VD4GJCMK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.06462&json=true","fetch_graph":"https://pith.science/api/pith-number/VD4GJCMK2MIPZ6TVHPQBDGUEC3/graph.json","fetch_events":"https://pith.science/api/pith-number/VD4GJCMK2MIPZ6TVHPQBDGUEC3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VD4GJCMK2MIPZ6TVHPQBDGUEC3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VD4GJCMK2MIPZ6TVHPQBDGUEC3/action/storage_attestation","attest_author":"https://pith.science/pith/VD4GJCMK2MIPZ6TVHPQBDGUEC3/action/author_attestation","sign_citation":"https://pith.science/pith/VD4GJCMK2MIPZ6TVHPQBDGUEC3/action/citation_signature","submit_replication":"https://pith.science/pith/VD4GJCMK2MIPZ6TVHPQBDGUEC3/action/replication_record"}},"created_at":"2026-07-05T10:50:42.430620+00:00","updated_at":"2026-07-05T10:50:42.430620+00:00"}