{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:ZSMJM7POEXDLYJJLH36BCRZMZW","short_pith_number":"pith:ZSMJM7PO","schema_version":"1.0","canonical_sha256":"cc98967dee25c6bc252b3efc11472ccdba43f07c56f22eb02d5e9fe928b42ccb","source":{"kind":"arxiv","id":"2411.03795","version":4},"attestation_state":"computed","paper":{"title":"VQA$^2$: Visual Question Answering for Video Quality Assessment","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Chunyi Li, Guangtao Zhai, Haoning Wu, Jiaying Qian, Weisi Lin, Wei Sun, Xiaohong Liu, Xiongkuo Min, Zicheng Zhang, Ziheng Jia","submitted_at":"2024-11-06T09:39:52Z","abstract_excerpt":"The advent and proliferation of large multi-modal models (LMMs) have introduced new paradigms to computer vision, transforming various tasks into a unified visual question answering framework. Video Quality Assessment (VQA), a classic field in low-level visual perception, focused initially on quantitative video quality scoring. However, driven by advances in LMMs, it is now progressing toward more holistic visual quality understanding tasks. Recent studies in the image domain have demonstrated that Visual Question Answering (VQA) can markedly enhance low-level visual quality evaluation. Nevert"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.03795","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-11-06T09:39:52Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"44c09c6ca7051544d6c928d34322f330b280aa64ac126daccaaaf7ed3b774d02","abstract_canon_sha256":"579742f5de07fa6e7842e7257618ab44f6aadccc8b162908aba954b690e97d33"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:43:11.228425Z","signature_b64":"/51aERFnkasOeXf5hd1e3EZ9hA+5els/X0B5JhRGS1QswOVr01awMI91StDe2hebcY217QGjkW6ZqTzmCSWYCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"cc98967dee25c6bc252b3efc11472ccdba43f07c56f22eb02d5e9fe928b42ccb","last_reissued_at":"2026-07-05T09:43:11.227883Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:43:11.227883Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VQA$^2$: Visual Question Answering for Video Quality Assessment","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Chunyi Li, Guangtao Zhai, Haoning Wu, Jiaying Qian, Weisi Lin, Wei Sun, Xiaohong Liu, Xiongkuo Min, Zicheng Zhang, Ziheng Jia","submitted_at":"2024-11-06T09:39:52Z","abstract_excerpt":"The advent and proliferation of large multi-modal models (LMMs) have introduced new paradigms to computer vision, transforming various tasks into a unified visual question answering framework. Video Quality Assessment (VQA), a classic field in low-level visual perception, focused initially on quantitative video quality scoring. However, driven by advances in LMMs, it is now progressing toward more holistic visual quality understanding tasks. Recent studies in the image domain have demonstrated that Visual Question Answering (VQA) can markedly enhance low-level visual quality evaluation. Nevert"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.03795","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.03795/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.03795","created_at":"2026-07-05T09:43:11.227947+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.03795v4","created_at":"2026-07-05T09:43:11.227947+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.03795","created_at":"2026-07-05T09:43:11.227947+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZSMJM7POEXDL","created_at":"2026-07-05T09:43:11.227947+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZSMJM7POEXDLYJJL","created_at":"2026-07-05T09:43:11.227947+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZSMJM7PO","created_at":"2026-07-05T09:43:11.227947+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2505.03631","citing_title":"Generalizable Video Quality Assessment via Weak-to-Strong Learning","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZSMJM7POEXDLYJJLH36BCRZMZW","json":"https://pith.science/pith/ZSMJM7POEXDLYJJLH36BCRZMZW.json","graph_json":"https://pith.science/api/pith-number/ZSMJM7POEXDLYJJLH36BCRZMZW/graph.json","events_json":"https://pith.science/api/pith-number/ZSMJM7POEXDLYJJLH36BCRZMZW/events.json","paper":"https://pith.science/paper/ZSMJM7PO"},"agent_actions":{"view_html":"https://pith.science/pith/ZSMJM7POEXDLYJJLH36BCRZMZW","download_json":"https://pith.science/pith/ZSMJM7POEXDLYJJLH36BCRZMZW.json","view_paper":"https://pith.science/paper/ZSMJM7PO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.03795&json=true","fetch_graph":"https://pith.science/api/pith-number/ZSMJM7POEXDLYJJLH36BCRZMZW/graph.json","fetch_events":"https://pith.science/api/pith-number/ZSMJM7POEXDLYJJLH36BCRZMZW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZSMJM7POEXDLYJJLH36BCRZMZW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZSMJM7POEXDLYJJLH36BCRZMZW/action/storage_attestation","attest_author":"https://pith.science/pith/ZSMJM7POEXDLYJJLH36BCRZMZW/action/author_attestation","sign_citation":"https://pith.science/pith/ZSMJM7POEXDLYJJLH36BCRZMZW/action/citation_signature","submit_replication":"https://pith.science/pith/ZSMJM7POEXDLYJJLH36BCRZMZW/action/replication_record"}},"created_at":"2026-07-05T09:43:11.227947+00:00","updated_at":"2026-07-05T09:43:11.227947+00:00"}