{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:5MMVAHXIXDDSLPCVQS2RO4V5E3","short_pith_number":"pith:5MMVAHXI","schema_version":"1.0","canonical_sha256":"eb19501ee8b8c725bc5584b51772bd26dee4fdfe9e6ae9247d8976003dfe651b","source":{"kind":"arxiv","id":"2011.13406","version":2},"attestation_state":"computed","paper":{"title":"Learning from Lexical Perturbations for Consistent Visual Question Answering","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Heng Ji, Hui Wu, Kate Saenko, Rogerio Feris, Spencer Whitehead, Yi Ren Fung","submitted_at":"2020-11-26T17:38:03Z","abstract_excerpt":"Existing Visual Question Answering (VQA) models are often fragile and sensitive to input variations. In this paper, we propose a novel approach to address this issue based on modular networks, which creates two questions related by linguistic perturbations and regularizes the visual reasoning process between them to be consistent during training. We show that our framework markedly improves consistency and generalization ability, demonstrating the value of controlled linguistic perturbations as a useful and currently underutilized training and regularization tool for VQA models. We also presen"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2011.13406","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2020-11-26T17:38:03Z","cross_cats_sorted":[],"title_canon_sha256":"9074727cbdd5ab0b739622214f028b528984d34ab0690630b3e1ae7f47832bbd","abstract_canon_sha256":"90afdf0d373b1598f3d08c1eef0a8d275210526eba975ce7dd196cc74b1c3cb5"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T02:01:33.095695Z","signature_b64":"FvkmaxHK4i9LMfWl7mzkyvq9moXOc+a9JGsAht//ZwkWsBwO92Bxm7INQTdWao3vCAiILov7MO1BPGwcdFWuDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"eb19501ee8b8c725bc5584b51772bd26dee4fdfe9e6ae9247d8976003dfe651b","last_reissued_at":"2026-07-05T02:01:33.095096Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T02:01:33.095096Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Learning from Lexical Perturbations for Consistent Visual Question Answering","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Heng Ji, Hui Wu, Kate Saenko, Rogerio Feris, Spencer Whitehead, Yi Ren Fung","submitted_at":"2020-11-26T17:38:03Z","abstract_excerpt":"Existing Visual Question Answering (VQA) models are often fragile and sensitive to input variations. In this paper, we propose a novel approach to address this issue based on modular networks, which creates two questions related by linguistic perturbations and regularizes the visual reasoning process between them to be consistent during training. We show that our framework markedly improves consistency and generalization ability, demonstrating the value of controlled linguistic perturbations as a useful and currently underutilized training and regularization tool for VQA models. We also presen"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2011.13406","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2011.13406/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2011.13406","created_at":"2026-07-05T02:01:33.095162+00:00"},{"alias_kind":"arxiv_version","alias_value":"2011.13406v2","created_at":"2026-07-05T02:01:33.095162+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2011.13406","created_at":"2026-07-05T02:01:33.095162+00:00"},{"alias_kind":"pith_short_12","alias_value":"5MMVAHXIXDDS","created_at":"2026-07-05T02:01:33.095162+00:00"},{"alias_kind":"pith_short_16","alias_value":"5MMVAHXIXDDSLPCV","created_at":"2026-07-05T02:01:33.095162+00:00"},{"alias_kind":"pith_short_8","alias_value":"5MMVAHXI","created_at":"2026-07-05T02:01:33.095162+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/5MMVAHXIXDDSLPCVQS2RO4V5E3","json":"https://pith.science/pith/5MMVAHXIXDDSLPCVQS2RO4V5E3.json","graph_json":"https://pith.science/api/pith-number/5MMVAHXIXDDSLPCVQS2RO4V5E3/graph.json","events_json":"https://pith.science/api/pith-number/5MMVAHXIXDDSLPCVQS2RO4V5E3/events.json","paper":"https://pith.science/paper/5MMVAHXI"},"agent_actions":{"view_html":"https://pith.science/pith/5MMVAHXIXDDSLPCVQS2RO4V5E3","download_json":"https://pith.science/pith/5MMVAHXIXDDSLPCVQS2RO4V5E3.json","view_paper":"https://pith.science/paper/5MMVAHXI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2011.13406&json=true","fetch_graph":"https://pith.science/api/pith-number/5MMVAHXIXDDSLPCVQS2RO4V5E3/graph.json","fetch_events":"https://pith.science/api/pith-number/5MMVAHXIXDDSLPCVQS2RO4V5E3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/5MMVAHXIXDDSLPCVQS2RO4V5E3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/5MMVAHXIXDDSLPCVQS2RO4V5E3/action/storage_attestation","attest_author":"https://pith.science/pith/5MMVAHXIXDDSLPCVQS2RO4V5E3/action/author_attestation","sign_citation":"https://pith.science/pith/5MMVAHXIXDDSLPCVQS2RO4V5E3/action/citation_signature","submit_replication":"https://pith.science/pith/5MMVAHXIXDDSLPCVQS2RO4V5E3/action/replication_record"}},"created_at":"2026-07-05T02:01:33.095162+00:00","updated_at":"2026-07-05T02:01:33.095162+00:00"}