{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:6TZBCGS3WB4MZX4AMSQFDDH4JM","short_pith_number":"pith:6TZBCGS3","schema_version":"1.0","canonical_sha256":"f4f2111a5bb078ccdf8064a0518cfc4b198a5a500cf2c099644530a9db276917","source":{"kind":"arxiv","id":"2412.00876","version":4},"attestation_state":"computed","paper":{"title":"Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.CV","authors_text":"Fei Zhao, Shaohui Lin, Shaosheng Cao, Wenxuan Huang, Xiangfeng Xu, Yao Hu, Yunhang Shen, Zheyu Ye, Zijie Zhai","submitted_at":"2024-12-01T16:32:31Z","abstract_excerpt":"Multimodal Large Language Models (MLLMs) have achieved remarkable success in vision understanding, reasoning, and interaction. However, the inference computation and memory increase progressively with the generation of output tokens during decoding, directly affecting the efficacy of MLLMs. Existing methods attempt to reduce the vision context redundancy to achieve efficient MLLMs. Unfortunately, the efficiency benefits of the vision context reduction in the prefill stage gradually diminish during the decoding stage. To address this problem, we proposed a dynamic vision-language context sparsi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.00876","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-12-01T16:32:31Z","cross_cats_sorted":["cs.AI","cs.CL","cs.LG"],"title_canon_sha256":"d705626af55b438f381e1dd6a1c4ab5c0f17b5bbf3ace3afb78dc2afb48e397b","abstract_canon_sha256":"98df8f202cd2eba91b68dc4915fb1c442ad7fd31370832f8eec983d84ce90338"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:36:32.079915Z","signature_b64":"N5mwd2AJ5W3WH+4Hd2K1c30DqzN9mfVkWmLM0FaXeuPxebZhSG/JaUov0RnvFq677J3X/e5BLb+Es6hfKzQiBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f4f2111a5bb078ccdf8064a0518cfc4b198a5a500cf2c099644530a9db276917","last_reissued_at":"2026-07-05T10:36:32.079416Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:36:32.079416Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.CV","authors_text":"Fei Zhao, Shaohui Lin, Shaosheng Cao, Wenxuan Huang, Xiangfeng Xu, Yao Hu, Yunhang Shen, Zheyu Ye, Zijie Zhai","submitted_at":"2024-12-01T16:32:31Z","abstract_excerpt":"Multimodal Large Language Models (MLLMs) have achieved remarkable success in vision understanding, reasoning, and interaction. However, the inference computation and memory increase progressively with the generation of output tokens during decoding, directly affecting the efficacy of MLLMs. Existing methods attempt to reduce the vision context redundancy to achieve efficient MLLMs. Unfortunately, the efficiency benefits of the vision context reduction in the prefill stage gradually diminish during the decoding stage. To address this problem, we proposed a dynamic vision-language context sparsi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.00876","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.00876/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.00876","created_at":"2026-07-05T10:36:32.079480+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.00876v4","created_at":"2026-07-05T10:36:32.079480+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.00876","created_at":"2026-07-05T10:36:32.079480+00:00"},{"alias_kind":"pith_short_12","alias_value":"6TZBCGS3WB4M","created_at":"2026-07-05T10:36:32.079480+00:00"},{"alias_kind":"pith_short_16","alias_value":"6TZBCGS3WB4MZX4A","created_at":"2026-07-05T10:36:32.079480+00:00"},{"alias_kind":"pith_short_8","alias_value":"6TZBCGS3","created_at":"2026-07-05T10:36:32.079480+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.12412","citing_title":"Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23950","citing_title":"LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11627","citing_title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15188","citing_title":"VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6TZBCGS3WB4MZX4AMSQFDDH4JM","json":"https://pith.science/pith/6TZBCGS3WB4MZX4AMSQFDDH4JM.json","graph_json":"https://pith.science/api/pith-number/6TZBCGS3WB4MZX4AMSQFDDH4JM/graph.json","events_json":"https://pith.science/api/pith-number/6TZBCGS3WB4MZX4AMSQFDDH4JM/events.json","paper":"https://pith.science/paper/6TZBCGS3"},"agent_actions":{"view_html":"https://pith.science/pith/6TZBCGS3WB4MZX4AMSQFDDH4JM","download_json":"https://pith.science/pith/6TZBCGS3WB4MZX4AMSQFDDH4JM.json","view_paper":"https://pith.science/paper/6TZBCGS3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.00876&json=true","fetch_graph":"https://pith.science/api/pith-number/6TZBCGS3WB4MZX4AMSQFDDH4JM/graph.json","fetch_events":"https://pith.science/api/pith-number/6TZBCGS3WB4MZX4AMSQFDDH4JM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6TZBCGS3WB4MZX4AMSQFDDH4JM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6TZBCGS3WB4MZX4AMSQFDDH4JM/action/storage_attestation","attest_author":"https://pith.science/pith/6TZBCGS3WB4MZX4AMSQFDDH4JM/action/author_attestation","sign_citation":"https://pith.science/pith/6TZBCGS3WB4MZX4AMSQFDDH4JM/action/citation_signature","submit_replication":"https://pith.science/pith/6TZBCGS3WB4MZX4AMSQFDDH4JM/action/replication_record"}},"created_at":"2026-07-05T10:36:32.079480+00:00","updated_at":"2026-07-05T10:36:32.079480+00:00"}